본문으로 건너뛰기

Category

AI 리서치·논문

arXiv 논문과 대형 연구소의 기술 리포트를 추적하는 카테고리다. 모델 아키텍처, 학습 기법, 벤치마크 결과처럼 6개월 뒤 제품에 들어올 흐름을 미리 읽는다. 한국 개발자가 논문 전문을 다 읽지 않고도 핵심과 재현 가능성을 가늠하도록 정리한다.

News·

기계 학습 연구에서 재현 가능성의 중요성 감소

기계 학습 연구에서 재현 가능성이 감소하는 이유로는 고가의 하드웨어와 실험실이 필요한 물리적 AI 연구의 증가, AI 기업들이 주장하는 도구의 신뢰성 부족, 경쟁에 의해 비재현 가능한 작업을 생산하도록 유도되는 환경이 있다. 이러한 문제로 인해 연구자들은 실험 결과를 재현하기 어려워지고 있다.

r/MachineLearning
News·

OpenAI의 연구팀, 코딩 에이전트 활용 증가

OpenAI의 연구팀은 Recursive Self-Improvement(재귀적 자기 개선)과 관련된 새로운 AGI를 연구하고 있으며, 2026년부터 코딩 에이전트의 사용이 급증하고 있다. 2026년 2월부터 8월까지 연구자당 AI 지출이 증가하는 추세를 보였으며, 특히 7월 말에 GPT-6 Astra 모델에 대한 내부 접근이 이루어진 것으로 추정된다.

Simon Willison's Weblog
News·

LLM을 활용한 칼로리 평가 벤치마크 결과

LLM을 사용하여 식사 사진과 설명으로부터 칼로리를 평가하기 위한 벤치마크가 진행되었다. Nutrition5k 데이터셋을 사용하여 25개의 무작위 식사에 대해 모델을 평가한 결과, Muse Spark 1.3이 48%의 정확도로 가장 높은 성능을 보였고, Qwen 3.8 27b는 16%의 정확도를 기록했다. 모델의 크기와 성능 간의 상관관계는 명확하지 않았다.

r/LocalLLaMA
News·

LeVJEPA 연구, 자기지도학습의 효율성 극대화

최근 연구 'LeVJEPA'는 자기지도학습에서 표현 붕괴를 방지하기 위해 단 하나의 인코더와 손실 함수, 고정된 하이퍼파라미터를 사용하여 성능을 극대화했다. 이 연구는 입력 토큰의 95%를 무작위로 버리고 남은 5%로 학습을 진행하여, 기존 모델 'V-JEPA 2' 대비 5배에서 20배 적은 연산량으로 동등하거나 더 나은 성능을 달성했다. 또한, '블록 인과적 어텐션'을 통해 실시간 스트리밍 인식과 자율 월드 모델 구현에 최적화된 구조를 제공한다.

AI 코리아 커뮤니티 뉴스레터
News·

Aaron Levie, 오픈 AI 모델의 경제성과 미국 AI 생태계 강화 주장

Box의 공동 창립자이자 CEO인 Aaron Levie는 오픈 AI 모델이 더 많은 사용 사례를 창출하고, 폐쇄형 연구소가 더 빠르게 혁신하도록 유도하며, AI 경제의 본질적인 변화가 없다고 주장한다. 그는 미국이 중국과 경쟁하는 상황에서 접근 제한이 오히려 경쟁 AI 생태계를 가속화할 수 있다고 논의하고, 미국 연구소가 이전 세대 모델의 오픈 버전을 출시해야 한다고 제안한다. 또한, 최신 모델이 지식 작업에 미치는 영향과 Box에서 AI가 소프트웨어 엔지니어링을 어떻게 변화시켰는지에 대해 이야기한다.

AI + a16z
News·

Anthropic의 Fable 5.1과 OpenAI의 GPT-6 Astra 출시

AI in the AM의 하이라이트에서는 Anthropic의 Fable 5.1과 OpenAI의 GPT-6 Astra 출시가 포함된 중요한 주간을 다룬다. Nathan Labenz와 Prakash Narayanan은 안전 평가에서 개별 컨테이너를 집단 목표를 위해 희생하는 다중 에이전트 군집의 긴급한 검증 필요성에 대해 논의한다. Gradient의 Zach Bratun-Glennon과 Cerebras의 Angela Yeung도 참여하여 개방형 모델 격차 축소, 차별적 접근, 최전선 AI 시스템 평가의 도전 과제를 검토한다.

The Cognitive Revolution
News·

NVIDIA BioNeMo NIM 마이크로서비스를 통한 단백질 구조 예측

Agentic AI는 연구 방식을 변화시키고 있으며, AI 과학자들은 논문을 읽고, 가설을 제안하며, 모델을 호출하고, 다음에 우선시할 실험을 결정할 수 있다. 소프트웨어 엔지니어링에서 가치를 입증한 후, 코딩 에이전트는 생산 코드를 작성하고, 테스트하며, 배포하는 역할을 수행하고 있다. 과학 연구는 더 많은 요구와 반복적인 과정을 필요로 하며, 연구자들은 지속적으로 증거를 평가하고 가설을 수정한다.

NVIDIA Technical Blog
News·

사양적 디코딩을 통한 LLM 추론 가속화 방법

이 글은 AI 모델 공동 설계에 관한 시리즈의 세 번째 포스트로, 사양적 디코딩을 사용하여 LLM 추론을 가속화하면서 정확성을 유지하는 방법을 탐구한다. 또한, 파레토 프론티어를 기준으로 초안 길이 및 초안 메커니즘을 선택하기 위한 다섯 가지 가이드를 제공한다.

NVIDIA Technical Blog
News·

Anthropic의 IPO와 외부 신탁의 영향

Anthropic의 상장 계획에 따라 외부 신탁인 Long-Term Benefit Trust (LTBT)가 주목받고 있다. 이 신탁은 Anthropic의 이사회에서 대부분의 권한을 행사하며, 인류의 장기적 이익을 위한 AI 개발을 목표로 하고 있다. Anthropic은 최대 2조 달러의 가치를 지닌 상장 후에도 이 신탁의 역할을 유지할 계획이다.

Ars Technica — AI
News·

AI 시대의 메모리 및 스토리지 아키텍처

AI 추론 시대가 도래했다. AI 시스템은 성능, 대기 시간, 메모리 대역폭, 스토리지 처리량, 네트워킹을 최적화해야 하며, 이는 단일 작업이 아닌 수천, 수백만 개의 다양한 작업을 처리해야 한다. 데이터 센터는 지속적이고 분산된 AI 서비스를 지원해야 하며, 메모리와 스토리지는 시스템의 핵심으로 간주되어야 한다. 데이터 이동은 새로운 병목 현상으로, 효율적인 데이터 이동, 캐싱 및 전달이 중요하다. AI 인프라는 단순히 빠른 프로세서를 구매하는 것이 아니라, 메모리 대역폭과 스토리지 근접성 등 다양한 요소를 고려해야 한다.

MIT Technology Review — AI
News·

프롬프트 엔지니어링을 통한 일반 목적 AI 교육 보조 도구의 개인화 접근법

대규모 언어 모델(LLM)을 기반으로 한 AI 교육 보조 도구는 확장 가능한 교육 지원을 제공하지만 개인화가 제한적이다. 본 연구는 Jill Watson과 같은 LLM/RAG 기반 AI 교육 보조 도구의 개인화를 위한 프롬프트 엔지니어링 기반 프레임워크를 제시한다. 이 프레임워크는 자기 평가, 추상화 선호, 장황함 선호, 지각적 방향, 정보 처리 스타일, 이해 수준의 여섯 가지 학습자 특성을 사용하여 응답을 조정하며, 96개의 고유한 학습자 프로필을 생성한다. 학생의 질문은 Bloom의 분류학을 사용하여 인지 복잡성을 추정하고, 학습자 특성과 인지 평가를 구조화된 프롬프트에 인코딩하여 모델 재훈련 없이 LLM을 조정한다. 실험 결과는 개인화 조건에 따른 응답 스타일과 구조의 차이를 보여주며, 통계 분석을 통해 측정 가능한 응답 변화와 관련된 학습자 특성을 확인하였다.

arXiv cs.AI (인공지능)
News·

오픈 소스 AI 모델과 상업적 모델의 격차 감소

최신 AI 모델을 테스트한 결과, 최고의 오픈 소스 옵션과 상업적 모델 간의 차이가 미미하다는 의견이 제시되었다. 특히 Deepseek V4 flash와 같은 로컬 AI 모델이 최전선 연구소의 모델과 비슷한 성능을 보이고 있다는 점이 강조되었다. 이러한 상황은 AI 분야에서 비즈니스 모델이 생존하기 어려울 수 있음을 시사한다.

r/LocalLLaMA
News·

Project HydraFusion: 다중 모델 오케스트레이션을 통한 실행 계획 제공

Project HydraFusion은 여러 모델 제공자에서 모델을 선택하여 작업을 수행하는 실행 계획을 생성하는 연구 미리보기이다. 사용자는 GitHub Copilot CLI의 /experimental을 통해 HydraFusion을 선택하고, 모델의 성능, 비용, 지연 시간을 균형 있게 조정하는 워크플로우를 자동으로 선택한다. HydraFusion은 세 가지 실행 패턴(단일, 캐스케이드, 비평)을 통해 작업을 처리하며, TerminalBench 2.1에서 Claude Opus 5에 비해 67% 낮은 비용으로 4.9%의 품질 향상을 보여주었다.

GitHub Blog
News·

다중 턴 LLM 대화에서의 내러티브 포로 상태

대규모 언어 모델(LLM)이 일상적인 조언을 제공하는 상황에서, 모델이 한쪽의 주장을 완전한 것으로 간주하고 다른 관점을 찾지 않는 '내러티브 포로 상태'가 발생할 수 있음을 소개한다. 연구에서는 5,078개의 대인 갈등 시나리오를 기반으로, 17개의 LLM에서 다중 턴 내러티브에 따른 최종 판단이 평균 25% 포인트 변화하는 것을 발견했다. 이 현상은 선호 최적화가 주요 원인으로 작용하며, 네 가지 추론 시간 전략은 부분적으로만 완화할 수 있다.

arXiv cs.AI (인공지능)
News·

Internalized Visual Thinking(IVT) 도입으로 비디오 추론 최적화

다중 모달 대형 언어 모델은 공간적, 시간적, 구체적 환경에 대한 추론을 위해 시각적 사고 체인(Visual CoT)을 점점 더 많이 사용하고 있다. Visual CoT는 중간 추론 이미지를 생성하여 시각적 예측을 위한 직관적인 메커니즘을 제공하지만, 이는 상당한 추론 오버헤드를 초래하여 비디오 추론에 문제를 일으킨다. 본 연구에서는 모델이 훈련 중 시각적으로 사고하도록 학습할 수 있는지 여부를 탐구하며, 텍스트 예측과 비디오 추론을 동시에 최적화하는 Internalized Visual Thinking(IVT)이라는 포스트 훈련 프레임워크를 소개한다.

Apple Machine Learning Research
News·

Luce: 3D 자산 생성을 위한 재조명 가능한 가우시안

Luce는 기하학과 PBR(물리 기반 렌더링) 재료를 통합한 3D 표현 방식으로, 알베도, 금속성-거칠기 및 표면 법선과 같은 PBR 모달리티를 포함하는 복셀화된 다중 모드 가우시안 클라우드를 사용한다. 이 표현은 변분 오토인코더를 통해 통합된 재료 인식 잠재 공간으로 압축된다.

Apple Machine Learning Research
News·

미시간 농지에 계획된 70억 달러 스타게이트 데이터 센터 반대 시위

2025년 12월 1일, 미시간 농지에 70억 달러 규모의 스타게이트 데이터 센터 건설 계획에 대해 지역 주민들이 반대 시위를 벌였다. 이 문서에서는 '위대한 AI 실망'이라는 주제를 다루고 있다.

AI Supremacy (Michael Spencer)
News·

중국의 AI IPO가 글로벌 시장에 미치는 영향

중국에서 다수의 IPO가 진행되고 있으며, 이는 글로벌 AI 붐에 변화를 가져오고 있다. 2026년에는 Unitree Robotics, CXMT, Zhongji Innolight, AGIBOT, Moore Threads, Biren Technology, DeepSeek 등의 IPO가 예정되어 있다. 상하이 종합지수는 지난 18개월 동안 17.3% 상승했으나, 기술 기업들이 상장된 ChiNext, 상하이 STAR 시장, 홍콩 증시에서는 더 큰 성과를 보이고 있다.

AI Supremacy (Michael Spencer)
News·

AI 연구소의 경제적 가치와 경쟁력 변화

AI 연구소가 수십억 달러를 투자하여 최고의 모델을 훈련시키고 업계 이벤트로 출시하더라도, 6개월 후 다른 연구소가 비슷한 능력을 갖추고 저렴한 오픈 모델을 제공할 수 있다. AI는 성능 예측이 가능해지며, 자본이 중요해지지만, 자본과 경쟁력을 혼동하는 것이 위험하다. Hamilton Helmer의 Seven Powers 프레임워크는 좋은 제품과 지속 가능한 비즈니스를 구분하는 데 유용하다.

TheSequence (Jesus Rodriguez)
News·

Atlas: 새로운 시점 예측을 통한 공간 지능 모델

World Labs의 공동 창립자 Fei-Fei Li, Justin Johnson, Ben Mildenhall이 a16z의 Martin Casado와 함께 Atlas라는 최신 세계 모델에 대해 논의했다. Atlas의 핵심 기능은 '새로운 시점 예측'으로, 주어진 이미지나 장면의 뷰에서 다른 위치와 시간에서 환경이 어떻게 보일지를 예측하는 것이다. 이는 생성과 3D 재구성을 동일한 모델로 통합하며, 물리적 세계를 이해하는 데 유용한 기본 요소가 될 수 있는지에 대한 질문을 제기한다. 이들은 모델의 기술적 요소, 현재 캡처할 수 있는 것과 그렇지 않은 것, 그리고 세계 모델 개발에서 동적성, 편집 가능성, 시뮬레이션의 중요성에 대해 논의했다. 또한 창의적 작업, 건축, 로봇 공학에서의 응용 가능성도 탐구했다.

AI + a16z
News·

Claude Fable 5.1과 Mythos 5.1의 시스템 카드

Claude Fable 5.1은 출시 당시 가장 능력 있는 공개 AI 모델로, 200페이지 이상의 모델 카드가 제공된다. Fable 5.1은 Fable 5에 비해 상당한 개선이 이루어졌으며, 캐시 읽기 가격 인하로 인해 비용이 절감되었다. Mythos 5.1은 CB-2 분류에 미치지 못하며, 화학 및 생물학적 무기 제작에 대한 지원 능력이 여전히 제한적이다. 전반적으로 두 모델은 비슷한 복잡성을 지니고 있으며, Fable 5.1은 대부분의 작업에서 최상의 성능을 발휘한다.

Don't Worry About the Vase (Zvi Mowshowitz)
News·

우크라이나 드론 데이터가 방산 시장에 미치는 영향

우크라이나 전투에서 수집된 드론 데이터는 방산 분야에서 중요한 자원이 되고 있다. 우크라이나 국방부는 1월에 수집된 수백만 개의 데이터 포인트를 군 계약자와 상업 기업에 제공하기 시작했으며, 100개 이상의 기업과 영국 정부가 이 데이터에 접근했다. 이 데이터는 전투 환경에서 수집된 경험을 바탕으로 AI 모델 훈련에 활용되고 있으며, 전투가 상업 자산으로 전환되고 있다. 미국의 Enabled Intelligence는 이미 50만 시간 이상의 우크라이나 드론 영상을 AI 모델 훈련에 활용하고 있다.

MIT Technology Review — AI
News·

Mesh-Native Physics-Informed Graph Surrogates를 통한 TCAD 설계 공간 탐색

고충실도 TCAD 시뮬레이션은 FinFET 장치 설계의 핵심이지만, 3D 구조에서 계산 비용이 많이 듭니다. 기존의 머신러닝 대체물은 고정된 설계 매개변수를 몇 가지 장치 메트릭으로 매핑하여 물리학을 무시합니다. 제안된 물리정보 그래프 주의 네트워크(GAT) 대체물은 테트라헤드럴 TCAD 메쉬에서 직접 작동하며, 각 메쉬 노드에서 전기적 잠재력과 전자 및 홀 준 페르미 수준을 예측합니다. 이 모델은 적은 수의 핀 메쉬에서 훈련되어도 더 큰 배열에 적용할 수 있으며, GPU 메모리에 의해 추론이 제한됩니다. 다수의 핀 배열에서 직접 시뮬레이션하기 어려운 경우에도 1초 이내에 추론이 완료됩니다.

arXiv cs.LG (머신러닝)
News·

유클리드 데이터에서 그래프 구조 데이터로의 협업 학습 조사

기존 머신러닝 접근법은 데이터 수집, 모델 훈련, 추론을 단일 위치에서 수행하는 방식으로, 확장성과 프라이버시 문제로 제한을 받는다. 이를 해결하기 위해 최근 연구에서는 개별 에이전트가 로컬에서 훈련과 추론을 수행하는 연합 학습과 분산 학습 같은 협업 학습 접근법을 탐구하고 있다. 그러나 기존 연구는 주로 유클리드 데이터에 집중되어 있으며, 그래프 구조 데이터에서의 협업 학습 기회와 도전 과제는 충분히 탐구되지 않았다. 이 조사에서는 유클리드 데이터의 기본 원리를 검토하고, 그래프 구조 데이터에 대한 분류 체계와 알고리즘 프레임워크를 개발하며, 개방된 도전 과제와 연구 방향을 체계적으로 식별한다.

arXiv cs.LG (머신러닝)