Outcome-Only LLM 평가의 한계와 대안
trajectory-judge: What Outcome-Only LLM Judges Miss on Agent Trajectories
Outcome-only 평가 방식은 LLM 에이전트의 요청과 최종 응답만을 기준으로 평가하며, 잘못된 방법으로 올바른 답변에 도달한 경우를 간과한다. 연구에서는 400개의 경로를 통해 다섯 가지 평가자를 비교하였고, outcome-only 평가자는 84%의 소음 오류를 감지하지만 45%의 침묵 오류는 놓쳤다. 단계별 평가자는 3배의 비용으로 77%의 침묵 오류 회수를 달성하였다. 최종 응답을 읽지 않는 평가자들은 잘못된 약속이 포함된 경로를 완전히 회피할 수 있었다.
outcome-only 평가자는 33%의 올바른 경로를 잘못 플래그했으며, 이는 평가 방식의 한계를 나타낸다.
원문 출처
arXiv cs.CL (계산언어학·NLP)