On-Policy Distillation의 훈련 접근법
On-Policy Distillation
LLM은 입력 인식, 지식 검색, 계획 선택, 실행 능력 등 여러 기능을 결합하여 전문적인 성능을 발휘한다. 훈련 접근법은 크게 세 단계로 나뉜다: Pre-training, Mid-training, Post-training. Post-training에서는 On-policy training과 Off-policy training으로 나뉘며, On-policy training은 학생 모델의 샘플을 사용하고 Off-policy training은 외부 출처의 목표 출력을 모방한다. Off-policy training에서는 teacher 모델의 출력을 맞추는 distillation 기법을 사용할 수 있다.
원문 출처
Thinking Machines Lab Blog