rewardspy: RL 보상 함수의 보상 해킹 탐지 라이브러리
A debugger for RL reward functions that detects reward hacking during training [P]
GRPO 훈련 실험 중 보상이 증가할 때 정책이 실제로 개선되고 있는지 아니면 보상 함수를 악용하고 있는지 판단하기 어려운 문제를 해결하기 위해 'rewardspy'라는 라이브러리를 개발했다. 이 라이브러리는 기존의 보상 함수를 감싸고 보상 해킹을 선행하는 지표를 지속적으로 모니터링한다. 현재 추적하는 요소로는 롤링 보상 통계, 보상 분산 붕괴, 보상 구성 요소 불균형, 응답 길이 드리프트, 보상 기울기 변화, GRPO 그룹 붕괴 등이 있다.
원문 출처
r/MachineLearning