DeepSeek-R1: 고급 추론 모델의 훈련 방법
The Illustrated DeepSeek-R1
DeepSeek-R1은 오픈 가중치 모델로, 600,000개의 긴 추론 예제를 포함하여 훈련된다. 이 모델은 수학 및 추론 문제 해결에 뛰어나며, 기존 LLM과 마찬가지로 한 번에 하나의 토큰을 생성하지만, 사고 과정을 설명하는 토큰을 생성하는 데 더 많은 시간을 할애한다. R1은 DeepSeek-V3 모델의 기본 모델을 사용하며, 감독된 미세 조정(SFT) 및 선호 조정 단계를 거쳐 훈련된다. R1-Zero라는 모델을 통해 대규모 강화 학습을 활용하여 추론 모델을 생성하고, 이 과정에서 레이블이 없는 데이터로도 훈련이 가능하다.
원문 출처
Language Models & Co. (Jay Alammar)