상대적 선호 평가를 위한 합의 기반 프레임워크
A Consensus-Based Framework for Relative Preference Evaluation of Large Language Models
전통적인 LLM 벤치마크는 정적 데이터셋과 객관적 점수 기준에 의존하여, 여러 답변이 허용되는 경우 응답 품질의 차이를 포착하지 못하는 한계가 있다. 본 논문은 모델 생성 응답 간의 상대적 선호를 측정하는 합의 기반 평가 프레임워크를 소개한다. 다섯 개의 최첨단 LLM을 사용하여 프로그래밍, 일반 지식, 안전, 논리적 추론, 수학 등 여러 분야에서 응답을 생성하고, 각 모델이 동료 출력을 구조화된 투표 과정을 통해 독립적으로 평가한다. 점수는 상대 지능 지수(RII)로 집계되어 모델의 응답이 다른 모델에 의해 얼마나 선호되는지를 나타낸다. 이 프레임워크는 여러 유효한 답변이 존재하는 상황에서 응답 품질에 대한 대안적 관점을 제공한다.
상대 지능 지수(RII)는 모델 간의 응답 선호도를 측정하여, 응답 품질을 비교하는 새로운 방법론을 제시한다.
원문 출처
arXiv cs.CL (계산언어학·NLP)