GSPO 알고리즘을 통한 언어 모델을 위한 강화 학습 확장
GSPO: Towards Scalable Reinforcement Learning for Language Models
강화 학습(RL)은 언어 모델의 확장과 깊은 추론 및 문제 해결 능력 향상을 위한 중요한 패러다임으로 자리잡고 있다. 그러나 기존의 RL 알고리즘인 GRPO는 긴 훈련 과정에서 심각한 불안정성을 보이며 모델 붕괴를 초래하여 성능 향상을 저해하고 있다. 이를 해결하기 위해 Group Sequence Policy Optimization(GSPO) 알고리즘을 제안한다.
원문 출처
Qwen Blog (Alibaba)