AI 과학자 시스템의 자율 연구 생성 평가를 위한 벤치마킹 연구
Can AI Evaluate AI Scientists? A Benchmarking Study of Autonomous Research Generation Systems Using Automated Multi-Model Review
AI 과학자 시스템은 자율 연구를 통해 과학 발견을 가속화할 수 있는 잠재력을 가지고 있다. 그러나 AI가 생성한 논문의 품질을 평가하고 비교하는 것은 여전히 도전 과제이다. 본 연구에서는 네 가지 핵심 차원(독창성, 과학적 엄밀성, 명확성, 중요성)을 평가하기 위해 자동화된 동료 검토 시스템을 활용한 엄격한 벤치마킹 프로토콜을 제안하고 구현하였다. extit{Sakana AI (v1 & v2)}, extit{CycleResearcher}, extit{Data-to-Paper}의 네 가지 AI 과학자 프레임워크를 평가하였으며, 상업적 자율 AI 과학자 회사(FARS)가 발표한 15개의 연구 제안서를 기반으로 60개의 논문을 생성하고, 이들을 15개의 FARS 벤치마크 논문과 함께 평가하였다. 평가 결과, FARS 벤치마크 논문은 다른 시스템보다 평균 점수가 2.14~2.47로 유의미하게 높았고, Gemini와 Claude 평가에서 2배 이상의 점수를 기록하였다.
FARS 벤치마크 논문은 다른 시스템보다 평균 점수가 2.14~2.47로 유의미하게 높아, AI 과학자 시스템의 품질 평가에 대한 신뢰성을 입증하였다.
원문 출처
arXiv cs.AI (인공지능)