Qwen2.5-0.5B-Instruct의 재귀 깊이 추가 및 성능 분석
Retrofitting Recurrent Depth into a Pretrained Language Model: Installation, Extrapolation, Transfer, and Retention at Two Parameter Budgets
Qwen2.5-0.5B-Instruct 모델은 재귀 깊이를 추가하여 반복적인 잠재 전이를 학습할 수 있으며, 이는 결과만 평가하는 경우에도 지속된다. 이 모델은 두 가지 예산에서 설치 가능하며, 6M 훈련된 매개변수와 180M 전체 블록을 사용한다. 모델은 각 루프에서 하나의 작업 단계를 계산하고 최종 답변이 평가될 때도 지속된다. 재귀 모델은 84%의 정확도를 기록하며, 10 깊이 이상에서 53%의 정확도를 유지하고, 7.6배 빠른 응답 속도를 보인다.
Qwen2.5-0.5B-Instruct는 6M 훈련된 매개변수로도 효과적인 성능을 발휘할 수 있다.
원문 출처
arXiv cs.CL (계산언어학·NLP)