LLM 평가 패널의 신뢰성 분석
Nine Judges, Two Effective Votes: Correlated Errors Undermine LLM Evaluation Panels
LLM-as-a-judge 패널은 여러 모델의 투표를 집계하여 신뢰성 있는 평가를 기대하지만, 9개의 최전선 LLM 모델이 3개의 자연어 추론 데이터셋에서 테스트한 결과, 9명의 판사가 제공하는 정보는 약 2개의 독립적인 투표에 해당하는 것으로 나타났다. 패널의 명목상 독립성의 약 75%가 상관 오류로 인해 저하되었다.
이 연구는 LLM 평가의 신뢰성을 높이기 위한 모델 선택 및 평가 방법론에 대한 중요한 통찰을 제공한다.
원문 출처
Apple Machine Learning Research