본문으로 건너뛰기

Category

AI 리서치·논문

arXiv 논문과 대형 연구소의 기술 리포트를 추적하는 카테고리다. 모델 아키텍처, 학습 기법, 벤치마크 결과처럼 6개월 뒤 제품에 들어올 흐름을 미리 읽는다. 한국 개발자가 논문 전문을 다 읽지 않고도 핵심과 재현 가능성을 가늠하도록 정리한다.

News·

OpenAI, 90년간 미해결된 Navier-Stokes 문제 해결 발표

OpenAI는 90년간 미해결 상태였던 Navier-Stokes 문제에 대한 해결책을 발견했다고 발표했다. 이 문제는 액체와 기체의 흐름과 관련이 있으며, OpenAI는 GPT-6 Astra보다 강력한 내부 AI 모델과 10,000개의 동시 에이전트를 사용하여 이를 해결했다. Navier-Stokes 문제는 7개의 밀레니엄 상 문제 중 하나로, 해결 시 100만 달러의 보상이 주어진다. OpenAI는 이 내부 AI 모델의 훈련을 8월 28일에 시작했다고 밝혔다.

The Verge — AI
News·

대규모 언어 모델의 제2차 사회적 추론 평가

이 연구는 대규모 언어 모델(LLM)의 제2차 사회적 규범인 메타규범을 평가하기 위한 새로운 프레임워크를 소개한다. 메타규범은 사회 규칙이 위반될 때 사람들의 반응을 지배하는 기대를 포함한다. 연구팀은 450개의 규범 위반 시나리오로 구성된 NormReact라는 다각적 데이터셋을 공개하였으며, 감정과 행동 반응을 성별 및 사회적 친밀도에 따라 수작업으로 주석을 달았다. 현재 LLM은 인간이 예상하는 비활동보다 부정적인 제재를 과도하게 예측하며, 사회적 거리 증가에 따라 인간 판단과의 일치도가 저하되는 경향이 있다.

arXiv cs.AI (인공지능)
News·

구글, AI 기상 모델 WeatherNext 3.0 업데이트로 예측 정확도 향상

구글은 WeatherNext 모델의 버전 3을 출시했다. 이번 업데이트의 주요 변경점은 위성 기상 데이터를 수집하여 현재 기상 조건과 새로운 예측 생성 간의 지연 시간을 단축시켰다는 것이다. 이 모델은 전통적인 기상 모델과 유사한 예측 성능을 제공하면서도 훨씬 적은 컴퓨팅 자원을 요구하여 더 자주 실행될 수 있다.

Ars Technica — AI
News·

손상 인식 다중 무장 강도 선택을 통한 비전 및 언어 변환기 가지치기

구조적 포스트 트레이닝 가지치기는 기능 단위를 선택하여 제한된 성능 저하를 유발하는 방식으로 이루어진다. 이 연구에서는 언어 및 비전 변환기의 구조적 단위 선택을 손상 인식 다중 무장 강도 문제로 공식화하고, 주어진 후보 평가 예산 하에서 진행된다. 실험은 WikiText-2, LAMBADA, Imagenette에서 GPT-2, OPT, Pythia, Qwen2.5, SmolLM2, ViT-B/16, DeiT-Tiny, Swin-Tiny 모델을 대상으로 하여 랜덤, 크기, 정적 중요도, 예산 기반 탐색 방법과 비교하였다. 다섯 개의 시드에서, 밴딧 방법이 예산 기반 탐색에 비해 성능 저하를 줄이는 경향을 보였다.

arXiv cs.AI (인공지능)
News·

MERIT: LLM 에이전트를 위한 장기 기억 평가 벤치마크

LLM 에이전트의 장기 기억을 평가하기 위해 MERIT(Memory Evaluation for Realistic Instrumented Tasks)라는 벤치마크가 제안되었다. MERIT는 세 가지 도메인에서 에피소드 도구 사용 작업을 제공하며, 이전 에피소드 사실에 대한 의존성을 자동화된 누수 점검으로 검증한다. 23,440개의 에피소드에서 메모리가 의존 작업 성공률을 0.00에서 0.55-1.00으로 향상시키는 것으로 나타났다. 업데이트된 사실에 대한 임베딩 검색은 모델 간에 0.30-0.95로 불안정하며, 에이전트는 올바르게 검색된 값을 55%의 확률로만 사용한다. 메모리 구현을 교체하면 작업 성공률이 최대 60포인트까지 변화할 수 있다.

arXiv cs.AI (인공지능)
News·

GPT-5.6 Sol을 통한 양자 컴퓨팅 실험 운영

OpenAI의 GPT-5.6 Sol이 양자 컴퓨팅 실험을 운영하는 데 사용되고 있다. 관련된 정보는 OpenAI의 공식 웹사이트와 Hacker News에서 확인할 수 있다.

Hacker News — AI 검색 피드 (hnrss)
News·

Qwen-Drive-1.0: 자율주행을 위한 비전-언어 모델

Qwen은 자율주행을 위한 비전-언어 모델인 Qwen-Drive-1.0을 발표했다. 이 모델은 3D 인식, 시각적 질문 응답, 동작 계획을 통합한 구조를 가지고 있으며, 외부의 조감도(BEV) 인식 헤드를 통해 3D 객체 탐지, 의미론적 점유 예측 및 BEV 맵 분할을 수행한다. 또한, 주행 감독과 일반 비전-언어 데이터를 결합한 단계적 훈련 방법을 통해 주행 관련 능력을 습득하면서도 폭넓은 시각적 이해와 지시 따르기 능력을 유지한다.

r/LocalLLaMA
News·

OpenAI, Navier–Stokes 문제 해결 결과 발표

OpenAI는 공개되지 않은 모델을 사용하여 Navier–Stokes 존재성과 매끄러움 문제를 해결했다고 발표했다. 이 문제는 2000년 5월 24일부터 100만 달러의 상금이 걸린 밀레니엄 문제 중 하나이다. OpenAI 팀은 9월 1일에 시작하여 9월 5일에 해결에 도달했으며, 이 과정에서 2.7백만 메시지를 보내고 약 130억 개의 출력 토큰을 사용했다. 그러나 NYU의 Tristan Buckmaster 교수는 OpenAI가 자신의 팀의 작업을 알지 못한 상태에서 유사한 문제를 해결했다고 주장하고 있다.

Simon Willison's Weblog
News·

Pathway의 뇌 영감을 받은 BDH 아키텍처와 Amazon SageMaker HyperPod

Pathway의 BDH(Dragon Hatchling) 모델은 잠재 공간에서 추론을 수행하며, 중간 텍스트 추적 없이 예제에서 학습하고 해결책을 정제한다. 이 모델은 신경망의 그래프를 기반으로 하며, 희소하고 지역적인 상호작용을 통해 통신하고 시냅스와 유사한 연결로 상태를 유지한다. Amazon SageMaker HyperPod는 Pathway의 BDH 모델 훈련을 확장하는 데 사용된다.

AWS Machine Learning Blog
News·

REFACTOR-VLA: 비지도 학습을 통한 타입화된 모터 프로그램 라이브러리

현재의 비전-언어-행동(VLA) 모델인 OpenVLA, π0, RT-2, RDT-1B는 '모놀리식' 구조로, 원시 모터 명령이나 짧은 행동 시퀀스를 생성하며, 재사용 가능한 추상화로 행동을 조직하지 않는다. 이로 인해 장기 과제에서 성능이 저하되고 학습한 내용을 해석하기 어렵다. 기존 기술 발견 접근법은 두 행동 시퀀스가 '행동적으로 동등한지' 결정하는 핵심 문제를 회피하는 경향이 있다.

Apple Machine Learning Research
News·

Latent Space Frontier AEO Tracker의 모델 선택 분석

Latent Space의 Frontier AEO Tracker는 161개 카테고리에서 7개 모델에 대해 6가지 프롬프트 변형을 실행하여 결과를 도출했다. Astra는 추천 결과의 신뢰성과 효율성을 높이며, 모델 간 선택의 변화가 관찰되었다. 예를 들어, Sol 모델은 평균 9개의 출처를 검색하는 반면, Astra는 5개로 더 적은 출처를 사용하지만 더 높은 신뢰성을 보였다. 또한, AEO 점수는 첫 번째 선택, 대안 선택, 언급 및 부정적인 추천에 가중치를 두어 평가된다.

Latent Space (swyx & Alessio)
News·

오픈 소스가 AI 권력을 집중화로부터 보호할 수 있을까?

MTS 호스트 소피아 듀가 샌프란시스코에서 열린 오픈 소스 AI 서밋에서 연구자들과 창립자들에게 오픈 소스가 AI 권력을 몇몇 기업의 손에 집중되는 것을 막을 수 있는지에 대한 질문을 던졌다. 'Attention Is All You Need'의 공동 저자 루카스 카이저는 현재의 집중화가 현재 기술 패러다임의 특징일 수 있다고 주장했다. 트랜스포머는 대량의 데이터와 컴퓨팅을 보상하지만, 미래의 혁신은 더 작고 전문화된 모델을 더욱 유능하게 만들 수 있다. 소피아는 오픈 모델, 인프라, 애플리케이션에 대한 연구자들과의 대화를 통해 중국이 오픈 가중치 모델에서 선두를 차지한 이유, 미국이 더 많은 오픈 모델 스타트업이 필요한지, 기업이 자사의 지능을 소유하는 것이 무엇을 의미하는지, 그리고 컴퓨팅 접근이 여전히 집중되어 있을 때 개방성만으로는 부족한 점을 탐구했다.

AI + a16z
News·

AI와 협업 시 발생하는 판단력 저하와 평가 부담

Microsoft Research와 CMU 연구진은 319명의 지식노동자로부터 수집한 936개의 생성형 AI 업무 사례를 분석하여, AI에 대한 신뢰가 높을수록 비판적 사고가 줄어드는 경향을 발견했다. AI의 결과물을 직접 생성하지 않고 평가하는 역할로 이동하면 인지적 부담이 증가하며, AI 사용 집단의 이해도 점수가 직접 코딩한 집단보다 낮은 경향을 보였다. AI와의 협업에서 작업 과정에 얼마나 관여했는지가 결과물 이해도에 큰 영향을 미친다.

요즘IT (Yozm IT)
News·

NVIDIA Omniverse NuRec로 차량 플랫폼 간 인식 스택 확장

인식 스택은 이를 탑재한 차량에 의해 형성된다. 동일한 소프트웨어를 SUV에서 세단과 같은 새로운 차량 모델로 이동할 경우, 인식 세계가 변화한다. 센서 배치, 보정, 시야, 가림, 차체 기하학, 타이밍 및 커버리지 등이 모두 달라진다. 예를 들어, 신호등이 프레임의 다른 위치에 나타날 수 있다.

NVIDIA Technical Blog
News·

OpenAI의 Jakub Pachocki, AI 모니터링 문제 경고

OpenAI의 수석 과학자 Jakub Pachocki는 AI의 재귀적 자기 개선이 몇 년 내에 발생할 것이라고 경고하며, 현재 AI의 모니터링 기술이 실패하고 있다고 언급했다. 그는 목표 정렬과 가치 정렬의 중요성을 강조하며, AI의 안전성을 확보하기 위해 국제적인 협력이 필요하다고 주장했다. Pachocki는 AI의 발전 속도가 지속될 경우, 더 많은 능력의 도약이 예상된다고 경고하며, AI 연구자들이 자동화된 정렬 연구에 대한 투자가 필요하다고 강조했다.

Don't Worry About the Vase (Zvi Mowshowitz)
News·

VERGE: 조기 발병 대장암 증상 추출을 위한 검증 강화 정제 방법

조기 발병 대장암이 증가하고 있지만, 이 연령대의 적신호 증상에 대한 근거 기반 가이드라인이 부족하다. 본 연구는 자유 텍스트 임상 노트에서 여섯 가지 적신호 증상과 가족력 위험 상태를 자동으로 추출하는 방법을 개발하고 평가하였다. VERGE라는 에이전틱 워크플로우를 통해 초기 레이블과 증거를 제안한 후, 텍스트 기반 검증 및 정제 사이클을 거쳐 오류를 수정하고 재검토하였다. VERGE는 4,033개의 임상 레이블 노트-발견 쌍에서 평가되었으며, 단일 에이전트 기준선과 비교해 거짓 긍정 발견을 줄이고 정밀도를 0.764에서 0.849로 향상시켰다. 대부분의 오류를 자율적으로 해결하였고, 인간 검토는 1.5%의 주장에만 필요했다.

arXiv cs.CL (계산언어학·NLP)
News·

양자 보조 메모리 효율적 훈련 프레임워크(Q-MET) 제안

Wi-Fi 기반 인간 활동 인식(HAR) 시스템은 기존의 딥러닝 모델이 훈련과 추론에서 메모리와 계산 자원을 많이 소모하여 실제 배치에 어려움이 있다. 본 논문에서는 훈련과 추론의 효율성을 개선하기 위해 양자 보조 메모리 효율적 훈련 프레임워크(Q-MET)를 제안한다. Q-MET는 하이브리드 양자 고전 신경망을 활용하여 HAR 모델의 파라미터 수를 줄이며, 기존의 역전파 기반 훈련에 비해 90%에서 95%까지 훈련 가능한 파라미터 수를 감소시킨다. 또한, 구조적 가지치기를 통해 75%에서 85%의 모델 희소성을 달성하면서도 분류 정확도의 손실을 2% 미만으로 유지한다.

arXiv cs.LG (머신러닝)
News·

정신 건강 위기 상담사의 대화 기술 발전 예측

이 연구는 정신 건강 상담에서 대화 기술이 중요하다는 점을 강조하며, 자원봉사 상담사들이 제한된 감독과 구조화된 피드백에 접근하는 상황에서 그들의 대화 능력 발전을 예측하는 방법을 제시한다. 상담사가 긍정적인 결과로 대화를 이끌어내는 능력을 향상시키는지를 조기에 예측하는 작업을 도입하고, 상담사가 처음에 어려움을 겪는 대화의 순간을 식별하고 이후 유사한 순간에서 어떻게 반응을 조정하는지를 분석한다. 이러한 초기 적응이 몇 달 또는 몇 년 후의 개선을 예측하는 데 도움이 된다는 통찰을 바탕으로, 상담사 적응 접근법이 대화 기록에서 직접 학습하는 기존 방법보다 더 나은 결과를 도출함을 보여준다.

arXiv cs.CL (계산언어학·NLP)
News·

AI 채용 시스템의 발전과 평가 및 거버넌스에 대한 체계적 서사 리뷰

AI를 활용한 채용 시스템은 프로필 쌍과 순위 목록에서 다단계 워크플로우로 변화하여 후보자를 비교하고 지원 또는 실행하는 작업을 자동화하고 있다. 이 리뷰는 양방향 검색 및 행동 순위에서 신경망 기반의 인물-직무 매칭, 대형 언어 모델(LLM) 구성 요소, 도구를 사용하는 채용 에이전트로의 발전을 추적한다. 2026년 7월 23일까지 업데이트된 검색 및 코딩 프로토콜을 사용하여 40개의 대표적인 연구를 정리하였으며, 평가 증거에서 가장 강력한 방어 가능한 주장으로의 단계적 매핑을 도입하고 있다. 또한, 채용 시스템의 진전을 평가하기 위해 적절한 증거를 검색하고 불확실성을 보존하며, 논란의 여지가 있는 결정을 지원하고 결과를 개선하는지 여부를 판단해야 한다.

arXiv cs.AI (인공지능)
News·

JEPA 스타일 월드 모델을 위한 스펙트럴-타겟 물리적 잠재 구조화

잠재 월드 모델은 픽셀 공간이 아닌 잠재 공간에서 예측 및 계획하는 방법으로 인기를 얻고 있다. 최근 LeWorldModel(LeWM) 아키텍처는 SIGReg와 같은 정규화 기법을 사용하여 인코더와 예측기를 공동 훈련하지만, 동적 환경에서 '물리적 표현 게으름'이라는 새로운 실패 모드를 발견했다. 이를 해결하기 위해 '푸리에 보조 헤드'를 사용하여 훈련 시 보조 감독을 제안하며, 이는 잠재 공간의 물리적 구조화를 강제하고 추가적인 추론 시간 비용 없이 다양한 환경에 일반화될 수 있다. 실험 결과, 이 보조 헤드는 동적 환경에서 계획 성공률을 크게 향상시키며, 저데이터 환경에서도 성공률을 증가시키는 데 효과적이다.

arXiv cs.LG (머신러닝)
News·

전력 시스템 보안을 위한 머신러닝 기반 비상 상황 분류 연구

본 연구는 전력 시스템의 보안을 위해 비상 상황을 안전, 중간, 심각 등급으로 분류하는 머신러닝 알고리즘의 사용을 탐구한다. Newton-Raphson 부하 흐름 방법을 통해 시스템 데이터를 추출하고, Overall Performance Index (OPI)를 안전 지표로 사용한다. 데이터 전처리에는 SMOTE와 PCA가 활용되며, K-최근접 이웃(KNN), 랜덤 포레스트(RF), 서포트 벡터 머신(SVM)이 훈련 및 평가된다. RF는 IEEE-30에서 0.97, IEEE-14에서 0.86의 F1 점수를 기록하며, SVM은 PCA의 도움으로 분류 정확도를 향상시킨다. 연구 결과는 머신러닝이 전통적인 비상 상황 분석의 대안으로서 실시간 보안 평가를 개선할 수 있음을 보여준다.

arXiv cs.AI (인공지능)
News·

Iris-mini와 Iris-pro: 35B-A3B 및 397B-A17B 규모의 검색 에이전트

Iris-mini와 Iris-pro는 각각 35B-A3B 및 397B-A17B 규모로 훈련된 두 개의 검색 에이전트이다. 이들은 웹 코퍼스의 하이퍼링크 구조에서 역으로 구성된 작업을 수행하며, 엔티티 그래프를 기반으로 다중 홉 체인을 작성하고, 비정답 엔티티를 설명 참조로 재작성한다. 이 과정에서 문자열 매칭으로 해결할 수 없는 질문만을 허용하고, RL을 통해 실시간 검색에 대해 정책을 최적화한다. 두 모델은 BrowseComp, BrowseComp-ZH, DeepSearchQA, HLE에서 각각 $82.2/84.8/86.9/52.3$ 및 $88.6/85.1/92.9/56.4$의 성과를 기록했다.

arXiv cs.AI (인공지능)
News·

NASA CRM 날개-몸체 구성에 대한 CFD 기반 서그릿 모델의 실험적 수정 프레임워크

고충실도 CFD 데이터로 훈련된 공기역학 서그릿 모델은 스칼라 출력 및 전체 필드를 정확하게 재현하지만, CFD와 실험 관측 간의 체계적 불일치로 인해 예측 정확도가 제한된다. 본 연구에서는 풍동 PSP 측정을 사용하여 CFD 훈련된 딥러닝 서그릿을 조정하는 실험적으로 기반한 수정 프레임워크를 제시한다. 2,300개의 고충실도 CFD 시뮬레이션으로 훈련된 Geotransolver 서그릿은 R2 > 0.99의 정확도로 CFD 통합 공기역학 힘과 피칭 모멘트를 재현하지만, 실험 데이터와 일치하지 않는다. 실험 정보를 통합하기 위해 두 개의 자유 스트림 마하 수(0.70 및 0.85)에서 PSP 측정값을 기반으로 수정 네트워크를 훈련하여 서그릿 예측과 실험 측정 간의 표면 압력 분포 불일치를 학습한다. 수정 후, 마하 0.85에서 PSP와의 일치도가 크게 개선되며, 예측 오류의 크기와 Cp에서 0.05를 초과하는 젖은 표면 비율이 감소한다.

arXiv cs.LG (머신러닝)
News·

대형 언어 모델에서의 증거 통합 이론

대형 언어 모델(LLM)이 외부 증거를 통합하는 방식은 아직 명확하지 않다. 연구에서는 증거가 수신자의 초기 답변 분포를 어떻게 변화시키는지를 설명하는 이론을 제시하며, 세 가지 예측을 도출했다. 첫째, 수신자에게 더 확률이 높은 후보가 더 설득력이 있다. 둘째, 수신자는 외부 오류보다 자신의 오류를 더 쉽게 통합한다. 셋째, 동일한 증거가 약한 모델에는 긍정적 영향을 미치고 강한 모델에는 부정적 영향을 미칠 수 있다. 이 연구는 1천만 건 이상의 실험과 12개의 LLM을 통해 확인되었다.

arXiv cs.CL (계산언어학·NLP)