2025년 LLM 발전: DeepSeek R1과 RLVR의 등장
The State Of LLMs 2025: Progress, Problems, and Predictions
2025년에는 LLM의 발전이 계속되었으며, 특히 DeepSeek의 R1 모델이 주목받았다. R1은 오픈 웨이트 모델로, 기존의 최고 상용 모델들과 비교할 만한 성능을 보였다. 이 모델은 강화 학습을 통해 추론 행동을 개발할 수 있음을 보여주었고, 훈련 비용이 예상보다 낮아 500만 달러에 이를 수 있다는 새로운 추정이 나왔다. 또한, RLVR 알고리즘이 도입되어 LLM의 후속 훈련에서 새로운 접근 방식을 제공하였다. 이러한 발전은 LLM의 성능 향상과 확장 가능성을 높이는 데 기여할 것으로 보인다.
원문 출처
Ahead of AI (Sebastian Raschka)