강화학습(RL) 모델과 감독학습(SFT) 모델의 수학적 문제 해결 성능 차이 분석
Probing the Origins of Reasoning Performance: Representational Quality for Mathematical Problem-Solving in RL vs. SFT Fine-Tuned Models
강화학습(RL)로 훈련된 대규모 추론 모델이 감독학습(SFT) 모델보다 수학적 추론 작업에서 더 높은 성능을 보이는 이유를 분석하였다. 연구 결과, RL 모델은 더 높은 정확도로 정답 예측을 수행하며, 이는 더 선형적으로 분리 가능하고 구조화된 표현을 나타낸다. 또한, RL 모델은 계층적 구조를 발전시키며, 깊은 층이 점진적으로 더 중요해지는 반면, SFT 모델은 중요성을 균일하게 분배한다. 반복 샘플링에 따른 토큰 수 변동성을 분석한 결과, 일부 RL 모델에서 더 높은 변동성이 관찰되었지만, 다른 모델에서는 강한 일관성을 보였다.
RL 모델이 SFT 모델보다 더 구조화된 표현을 통해 수학적 문제 해결에서 우수한 성능을 발휘함을 보여준다.
원문 출처
arXiv cs.AI (인공지능)