지식 증류가 소형 언어 모델의 편향에 미치는 비대칭적 효과
The Asymmetric Effects of Knowledge Distillation on Bias in Small Language Models
지식 증류가 소형 지침 조정 언어 모델에서 비대칭적 효과를 나타낸다. 명확한 작업에서는 Gemma-2-9B 교사로부터의 응답 기반 증류가 SmolLM2-1.7B-Instruct의 맥락 오버라이딩 오류율을 44%에서 24%로 줄인다. 그러나 모호한 작업에서는 같은 증류가 아이템별 거부 조정을 파괴하여, 기준 모델이 올바르게 거부한 15%의 항목이 고정관념 답변을 받는다. 두 번째 학생 모델인 OLMo-2-1B-Instruct에서도 유사한 패턴이 나타나며, 침묵 손실이 8%이고 채워진 침묵이 새로운 편향의 89%를 차지한다. 우리는 Per-Condition Calibration Diagnosis (PCCD)라는 세 단계 프로토콜을 제안하여 거부 조정, 맥락 추적, 능력 보존을 평가한다.
SmolLM2-1.7B-Instruct의 맥락 오버라이딩 오류율을 44%에서 24%로 줄이는 지식 증류의 효과는 모델 개선에 중요한 지표가 된다.
원문 출처
arXiv cs.CL (계산언어학·NLP)