Amazon Nova 2의 Self-Distilled Reasoning을 통한 SFT 개선
Exploring self-distilled reasoning for supervised fine-tuning with Amazon Nova
Supervised Fine-Tuning(SFT) 과정에서 고품질의 chain-of-thought(CoT) 추론을 생성하는 것이 비현실적이고 비용이 많이 드는 경우가 많다. Amazon Nova 2 모델은 추론 능력이 뛰어나며, SFT에서 golden CoT 추적이 필요하다. Self-Distilled Reasoning(SDR)은 Nova 2 Lite 모델의 추론을 활용하여 비추론 데이터셋에 대한 대체 수단을 제공하며, SFT의 성능을 개선하고 catastrophic forgetting 문제를 완화한다. SDR은 기존 SFT 데이터셋에 적용 가능하며, 모델 병합보다 목표 성능과 일반 성능을 모두 보존하는 데 효과적이다.
SDR은 SFT에서 수학 성능을 70%로 유지하면서 목표 성능을 평균 6.5% 향상시킬 수 있다.
원문 출처
AWS Machine Learning Blog