Selective on-policy distillation에서 공유 학습률의 비중립적 역할
A Shared Learning Rate Is Not a Neutral Control in Selective On-Policy Distillation
Selective on-policy distillation은 선택자가 가장 높은 점수를 매긴 토큰 위치에서만 학생을 훈련시킵니다. 기존 문헌에서는 공유 학습률을 중립적인 통제로 비교했으나, 연구 결과 이는 사실이 아님을 보여줍니다. LoRA를 사용한 GSM8K에서, 선택적 방법은 학습률에 따라 5.4 pp에서 17.7 pp까지 성능 차이를 보였으며, 이는 선택자와 학습률 간의 얽힘을 나타냅니다. 또한, 초기 학생에 의해 점수가 매겨진 동결된 선택지에서도 여전히 통계적으로 유의미한 얽힘이 발견되었습니다. 따라서 선택자 비교를 위해서는 공유 학습률 대신 arm x rate 행렬을 보고할 것을 권장합니다.
LoRA에서 선택적 방법은 학습률에 따라 5.4 pp에서 17.7 pp까지 성능 차이를 보이며, 이는 선택자와 학습률 간의 얽힘을 나타냅니다.
원문 출처
arXiv cs.LG (머신러닝)