본문으로 건너뛰기

Category

AI 리서치·논문

arXiv 논문과 대형 연구소의 기술 리포트를 추적하는 카테고리다. 모델 아키텍처, 학습 기법, 벤치마크 결과처럼 6개월 뒤 제품에 들어올 흐름을 미리 읽는다. 한국 개발자가 논문 전문을 다 읽지 않고도 핵심과 재현 가능성을 가늠하도록 정리한다.

News·

DeepSeek-R1: 고급 추론 모델의 훈련 방법

DeepSeek-R1은 오픈 가중치 모델로, 600,000개의 긴 추론 예제를 포함하여 훈련된다. 이 모델은 수학 및 추론 문제 해결에 뛰어나며, 기존 LLM과 마찬가지로 한 번에 하나의 토큰을 생성하지만, 사고 과정을 설명하는 토큰을 생성하는 데 더 많은 시간을 할애한다. R1은 DeepSeek-V3 모델의 기본 모델을 사용하며, 감독된 미세 조정(SFT) 및 선호 조정 단계를 거쳐 훈련된다. R1-Zero라는 모델을 통해 대규모 강화 학습을 활용하여 추론 모델을 생성하고, 이 과정에서 레이블이 없는 데이터로도 훈련이 가능하다.

Language Models & Co. (Jay Alammar)
News·

OpenAI의 GPT-OSS 출시 및 주요 특징

OpenAI는 GPT-OSS를 출시했으며, 이는 GPT-2 이후 6년 만의 주요 오픈 소스 LLM 릴리스이다. GPT-OSS는 기존의 오픈 모델들과 비교할 때 능력의 큰 도약은 아니지만, LLM의 발전을 되짚어볼 기회를 제공한다. GPT-OSS는 혼합 전문가 모델로, 입력 및 출력 메시지 형식이 다양하며, 사용자, 앱 빌더, 모델 후처리 사용자 등 세 가지 주요 사용자 유형에 맞춘 메시지 채널을 지원한다. 이 모델은 문제 해결 및 코딩 능력이 향상되었으며, 사용자는 추론 모드를 설정할 수 있다.

Language Models & Co. (Jay Alammar)
News·

무료 과정 'How Transformer LLMs Work' 개설

'How Transformer LLMs Work'는 현대 Transformer 아키텍처, 토크나이저, 임베딩 및 혼합 전문가 모델을 설명하는 약 90분 분량의 무료 과정이다. 이 과정에서는 LLM이 텍스트를 처리하는 방식과 Transformer 아키텍처의 주요 구성 요소를 코드 예제를 통해 배울 수 있다. 주요 주제로는 언어 표현의 진화, LLM 입력의 토큰화 과정, Transformer 블록의 세 가지 주요 단계, 주의(attention) 메커니즘, 캐시된 계산의 속도 향상 등이 포함된다. 과정이 끝나면 LLM 모델에 대한 논문을 이해하는 데 필요한 깊은 통찰력을 얻게 된다.

Language Models & Co. (Jay Alammar)
News·

NeurIPS 2025 연구 논문 시각화 및 주요 주제

NeurIPS 2025의 연구 논문이 발표되었으며, 이를 탐색할 수 있는 인터랙티브 시각화가 제공된다. 이 시각화는 Cohere의 생성 및 임베딩 모델을 활용하여 대규모 텍스트 아카이브를 탐색하며, 주요 주제로는 LLMs, 멀티모달리티, 강화 학습이 있다. 약 28%의 논문이 멀티모달리티를 주요 초점으로 하고, 13%는 강화 학습에 중점을 두고 있다. 또한, 약 766개의 논문이 추론을 핵심 주제로 다루고 있다.

Language Models & Co. (Jay Alammar)
News·

CANN의 발전과 Huawei Ascend 칩의 활용 사례

CANN은 현재 '청소년기'로 전환되었으며, 개발자들이 독립적으로 문제를 해결하고 코드 기여를 시작하고 있다. AIGCode는 Ascend 칩을 사용하여 7B 규모의 Mixture-of-Experts 모델을 사전 훈련하는 과정에서 65%의 Model Flops Utilization을 달성했으며, 이는 업계 평균의 거의 두 배에 해당한다. 또한, 한 상장 은행은 AI를 핵심 리스크 관리 프로세스에 직접 통합했다고 발표했다.

ChinAI (Jeffrey Ding)
News·

Anthropic의 2028년 미국-중국 AI 경쟁 시나리오

Anthropic은 2028년을 대비한 두 가지 AI 경쟁 시나리오를 제시했다. 첫 번째 시나리오는 미국이 AI에서 우위를 점하는 것이고, 두 번째는 중국의 AI 생태계가 동등하게 경쟁하여 '권위주의 AI 리더십'이 형성되는 것이다. 이들은 중국 연구소가 수출 통제된 칩에 접근하지 못하도록 하는 노력을 강화해야 한다고 주장했다.

ChinAI (Jeffrey Ding)
News·

Anthropic, 모델 수출 통제로 접근 제한

트럼프 행정부가 Anthropic의 모델에 대한 수출 통제를 시행하여 미국 시민의 접근을 제한했다. 이로 인해 Anthropic은 모델을 사용할 수 없게 되었다. AI의 작동 방식에 대한 이해 부족이 문제로 지적되고 있다.

Stratechery (Ben Thompson)
News·

Google DeepMind, 다수 AI 에이전트 상호작용의 위험성 연구에 1천만 달러 지원

Google DeepMind는 수백만 개의 AI 에이전트가 온라인에서 상호작용할 때 발생할 수 있는 위험을 연구하기 위해 1천만 달러를 지원한다고 발표했다. Rohin Shah는 이러한 에이전트들이 인간의 감독 없이 작업을 수행할 수 있게 되면서 새로운 위험이 발생한다고 경고했다. 이 연구는 Google DeepMind와 Schmidt Sciences, ARIA, Cooperative AI foundation, Google.org가 협력하여 진행된다. Shah는 다수의 에이전트가 상호작용할 때 발생할 수 있는 위험을 이해하기 위해 현실적인 시뮬레이션을 수행할 필요가 있다고 강조했다.

MIT Technology Review — AI
News·

Subquadratic, LLM의 수학적 병목 현상 해결 주장

Miami에 본사를 둔 AI 스타트업 Subquadratic이 대형 언어 모델(LLM)의 병목 현상을 해결했다고 발표했다. 이들은 SubQ라는 새로운 LLM을 개발했으며, 이 모델은 기존 모델보다 빠르고 저렴하며 에너지를 적게 사용한다고 주장한다. SubQ는 대부분의 모델보다 최대 12배 많은 텍스트를 동시에 처리할 수 있으며, Google DeepMind, OpenAI, Anthropic의 모델들과 비슷한 성능을 보인다고 한다. 그러나 초기에는 자가 평가 점수 외에 근거가 부족해 회의적인 반응을 얻었고, 최근에는 독립 평가 기관 Appen의 추가 테스트 결과를 공개했다. Subquadratic은 향후 결과를 완전히 검증한 후 발표할 계획이다.

MIT Technology Review — AI
News·

한국의 AI 사랑과 정부의 AI 발전 전략

서울에서의 경험을 통해 한국의 AI 기술 활용을 살펴보면, 무인 출입국 심사, 실시간 버스 정보 제공, AI 로봇 배달 등이 있다. 한국인은 AI에 대해 긍정적인 태도를 보이며, Pew Research Center 조사에 따르면 16%만이 AI에 대해 걱정하고 있다. 한국 정부는 AI를 경제 성장의 동력으로 삼고 있으며, 2024년 AI 기본법을 통과시켜 AI 개발을 촉진하고 있다. 2026년 스탠포드 AI 지수에 따르면 한국은 세계에서 세 번째로 많은 주목할 만한 AI 모델을 보유하고 있다.

MIT Technology Review — AI
News·

GSPO 알고리즘을 통한 언어 모델을 위한 강화 학습 확장

강화 학습(RL)은 언어 모델의 확장과 깊은 추론 및 문제 해결 능력 향상을 위한 중요한 패러다임으로 자리잡고 있다. 그러나 기존의 RL 알고리즘인 GRPO는 긴 훈련 과정에서 심각한 불안정성을 보이며 모델 붕괴를 초래하여 성능 향상을 저해하고 있다. 이를 해결하기 위해 Group Sequence Policy Optimization(GSPO) 알고리즘을 제안한다.

Qwen Blog (Alibaba)
News·

On-Policy Distillation의 훈련 접근법

LLM은 입력 인식, 지식 검색, 계획 선택, 실행 능력 등 여러 기능을 결합하여 전문적인 성능을 발휘한다. 훈련 접근법은 크게 세 단계로 나뉜다: Pre-training, Mid-training, Post-training. Post-training에서는 On-policy training과 Off-policy training으로 나뉘며, On-policy training은 학생 모델의 샘플을 사용하고 Off-policy training은 외부 출처의 목표 출력을 모방한다. Off-policy training에서는 teacher 모델의 출력을 맞추는 distillation 기법을 사용할 수 있다.

Thinking Machines Lab Blog
News·

LoRA의 파라미터 효율적 미세 조정 방법

LoRA는 기존 모델의 가중치 행렬 W를 수정된 버전 W' = W + γBA로 대체하여, 훨씬 적은 수의 파라미터로 업데이트를 표현하는 저차원 표현을 생성하는 파라미터 효율적 미세 조정(PEFT) 방법이다. LoRA는 원래 가중치를 변경하지 않고 어댑터(A와 B 행렬)를 훈련시키기 때문에, 단일 추론 서버에서 여러 어댑터를 동시에 메모리에 유지하고 샘플링할 수 있는 장점이 있다. 또한, LoRA는 더 적은 메모리를 사용하여 훈련할 수 있어 훈련의 접근성과 효율성을 높인다.

Thinking Machines Lab Blog
News·

신경망의 가중치 행렬 제약을 통한 최적화 방법

신경망의 텐서 크기를 관리하기 위해 정규화가 필요하며, 이는 가중치 행렬에 덜 적용된다. EDM2 확산 모델은 가중치 제약을 사용하여 이점을 보고하였고, BiT는 가중치 표준화를 사용한다. 가중치 행렬을 정규화하면 최적화 업데이트의 상대 크기를 이해하기 쉬워지고, 하이퍼파라미터 조정 시 중요한 텐서에 집중할 수 있다. 본 포스트에서는 신경망의 가중치 행렬을 서브 매니폴드에 제약하는 방법을 제안하며, Muon 최적화 알고리즘의 매니폴드 버전을 제안한다.

Thinking Machines Lab Blog
News·

상호작용 모델: 인간-AI 협업을 위한 확장 가능한 접근법

상호작용 모델의 연구 미리보기가 발표되었다. 이 모델은 외부 구조물 없이 상호작용을 원활하게 처리하며, 오디오, 비디오, 텍스트를 실시간으로 수집하고 반응할 수 있다. 다중 스트림, 마이크로 턴 설계를 통해 실시간 반응성을 보장하며, 새로운 상호작용 능력과 지능 및 반응성에서 최첨단 성능을 보여준다.

Thinking Machines Lab Blog
News·

Transformer 기반 모델의 저정밀 훈련 최적화

Transformer 아키텍처는 현대 대형 언어 및 생성 AI 모델의 핵심이다. 이러한 모델이 커짐에 따라 훈련에 소모되는 GPU 시간과 엔지니어링 반복 시간이 증가한다. 따라서 Transformer의 가속화는 성능 최적화뿐만 아니라 팀이 실험할 수 있는 속도와 훈련할 수 있는 모델의 크기에 직접적인 영향을 미친다.

NVIDIA Technical Blog
News·

2025년 LLM의 주요 변화: RLVR과 지능의 형태

2025년 LLM 생산 스택은 Pretraining(GPT-2/3), Supervised Finetuning(InstructGPT), Reinforcement Learning from Human Feedback(RLHF)에서 Reinforcement Learning from Verifiable Rewards(RLVR)로 변화했다. RLVR은 자동으로 검증 가능한 보상에 대해 LLM을 훈련시켜 문제 해결 전략을 개발하게 하며, 이는 이전 패러다임에서는 달성하기 어려웠던 것이다. OpenAI의 o1이 RLVR 모델의 첫 번째 시연이었고, o3(2025년 초)는 이 변화의 분기점이었다. 또한, LLM의 지능은 '동물'이 아닌 '유령'으로 비유되며, 이는 LLM의 성능이 불규칙적임을 나타낸다.

Andrej Karpathy Blog
News·

Gemini 3의 10년 전 Hacker News 토론 분석 프로젝트

Andrej Karpathy는 Gemini 3가 10년 후 Hacker News의 프론트 페이지를 환각하는 내용을 보고, 10년 전의 HN 프론트 페이지를 분석하기 위해 ChatGPT 5.1 Thinking을 활용했다. 그는 2015년 12월의 HN 프론트 페이지와 댓글 스레드를 수집하고, 이를 통해 과거의 예측과 실제 결과를 비교 분석하는 프로젝트를 진행하고 있다. 이 작업은 Opus 4.5를 사용하여 약 3시간 만에 완료되었으며, GitHub에 프로젝트 저장소가 있다.

Andrej Karpathy Blog
News·

AI R&D 자동화를 위한 작업 목록 개발

Epoch AI의 포스트에서 AI 연구 및 개발(R&D) 자동화를 위한 작업 목록의 필요성을 강조하고 있다. 연구자들은 AI R&D의 완전 자동화가 AI 발전을 가속화할 것이라고 보고 있으며, 이를 위해 AI R&D에 포함된 작업을 구체적으로 나열하는 것이 중요하다고 주장한다. 첫 번째 버전의 분류법이 제시되었으며, 여섯 가지 범주로 나뉘어 60개 이상의 작업이 포함되어 있다. 각 작업은 현재 AI가 얼마나 자동화하고 있는지를 0에서 5까지 평가받는다.

Epoch AI — Benchmarking Hub
News·

LifeSciBench: AI 시스템의 생명 과학 연구 평가 벤치마크 도입

LifeSciBench는 AI 시스템이 실제 생명 과학 연구 작업과 결정 과정을 어떻게 처리하는지를 평가하기 위해 전문가가 작성하고 검토한 벤치마크입니다.

OpenAI Blog
News·

OpenAI, 배포 시뮬레이션 도입으로 AI 모델 행동 예측

OpenAI는 배포 시뮬레이션(Deployment Simulation) 방법을 도입하여 실제 대화 데이터를 사용해 AI 모델의 행동을 배포 전에 예측하고, 이를 통해 안전성과 평가 정확성을 향상시키고자 한다.

OpenAI Blog
News·

Meta AI 부서의 비효율성과 직원 사기 저하

Meta의 새로 형성된 AI 부서에서 비효율성이 발생하고 있으며, 이로 인해 직원들의 사기가 더욱 저하되고 있다.

WIRED — AI
News·

GPT-5.5 Instant로 향상된 ChatGPT의 건강 및 웰니스 응답

GPT-5.5 Instant는 ChatGPT의 건강 및 웰니스 응답을 개선하며, 더 강력한 추론, 향상된 맥락 이해, 명확한 의사소통, 의사 정보 기반 평가를 제공합니다.

OpenAI News
News·

GPT-5.4를 활용한 AI 화학자가 의약 화학 반응 개선

OpenAI와 Molecule.one은 GPT-5.4를 사용하는 거의 자율적인 AI 화학자가 의약 화학에서 중요한 약물 제조 반응을 개선했다고 발표했다.

OpenAI News