GRPO를 통한 RLHF 특성 설치 실패 사례
Reproducing OpenAI’s “persistently beneficial models” - GRPO trait install barely moves. Ideas? [P] [R]
한 연구자가 RTX 3090을 사용해 GRPO를 통해 특성을 설치하려 했으나, 결과가 +2.4 포인트에 그쳤다. 연구자는 20개의 훈련 프롬프트가 너무 적다고 지적하며, 특성 지속성을 목표로 하고 있다. 사용된 모델은 Qwen2.5-7B-Instruct이며, 보상은 모델 평가를 통해 이루어졌다.
GRPO를 통해 특성을 설치하는 과정에서 20개의 프롬프트가 부족하다는 점은 향후 RLHF 연구에서 프롬프트 수의 중요성을 시사한다.
원문 출처
r/MachineLearning