2025년 LLM의 주요 변화: RLVR과 지능의 형태
2025 LLM Year in Review
2025년 LLM 생산 스택은 Pretraining(GPT-2/3), Supervised Finetuning(InstructGPT), Reinforcement Learning from Human Feedback(RLHF)에서 Reinforcement Learning from Verifiable Rewards(RLVR)로 변화했다. RLVR은 자동으로 검증 가능한 보상에 대해 LLM을 훈련시켜 문제 해결 전략을 개발하게 하며, 이는 이전 패러다임에서는 달성하기 어려웠던 것이다. OpenAI의 o1이 RLVR 모델의 첫 번째 시연이었고, o3(2025년 초)는 이 변화의 분기점이었다. 또한, LLM의 지능은 '동물'이 아닌 '유령'으로 비유되며, 이는 LLM의 성능이 불규칙적임을 나타낸다.
원문 출처
Andrej Karpathy Blog