LitReview Arena: 문헌 리뷰 에이전트 평가를 위한 배틀 스타일 플랫폼
LitReview Arena: Evaluating Literature Review Agents with Battle-Style Peer Review Platform
LitReview Arena는 문헌 리뷰 품질을 평가하기 위한 배틀 스타일 평가 플랫폼으로, AI 논문 작성 경험이 있는 분야 전문가들이 익명 초안을 비교하고, 전문 분야에 맞춰 주제를 매칭하여 다섯 가지 문헌 리뷰 특정 기준에 대한 결과를 제공합니다. 이 프로토콜을 통해 약 3,000개의 전문가 판단을 수집했으며, 현재 시스템이 인간 초안에 비해 전체 유용성에서 23.0%의 결정적 승률을 보이는 반면, Sonar Deep Research와 같은 에이전트 LLM은 기본 언어 모델보다 60% 이상 우수한 성능을 보였습니다. 또한, 기존 LLM-판단 방법은 인간 전문가와의 정렬이 부족하며(Spearman's rho=0.467), LitJudge라는 전문가 보정 평가자를 통해 정렬을 개선하여 Spearman's rho=0.78에 도달했습니다. 코드와 데이터는 https://github.com/VanellopeAsher/LitReview-Arena에서 공개됩니다.
원문 출처
arXiv cs.AI (인공지능)