RubricForge: 에이전트 평가에서 과도한 신뢰를 줄이는 보상 없는 평가 기준 유도
Inducing Reward-Free Judging Rubrics that Reduce Over-Crediting in Agent Evaluation
RubricForge는 소규모의 진실 레이블이 있는 경로 집합에서 에이전트 평가 기준의 텍스트를 유도하여 실제 결과에 기반을 두고, 이를 통해 환경 보상과의 일치를 극대화하도록 진화된 평가 기준을 제공한다. 이 방법은 7B 모델을 사용하여 tau-bench와 WebShop에서 평가를 수행했으며, 실패한 경로에 대한 과도한 신뢰를 약 절반으로 줄였다. 예를 들어, tau-bench에서의 잘못된 통과 비율은 0.115로, 기존의 G-Eval보다 개선되었다.
RubricForge는 tau-bench에서 실패한 경로에 대한 잘못된 통과 비율을 0.115로 줄여, 에이전트 평가의 신뢰성을 높인다.
원문 출처
arXiv cs.AI (인공지능)