CRUX 프로젝트와 오픈 월드 평가를 통한 AI 능력 측정
Open-world evaluations for measuring frontier AI capabilities
이 논문은 AI 모델의 능력을 평가하기 위한 새로운 방식인 '오픈 월드 평가'를 정의하고, 이를 통해 얻은 교훈과 최선의 실천 방안을 제시한다. CRUX라는 17명의 연구자 협력체가 정기적으로 오픈 월드 평가를 수행하며, 첫 실험으로 AI 에이전트가 iOS 앱을 개발하고 App Store에 게시하는 과정을 진행하였다. 이 과정에서 두 가지 오류가 발생했으며, 이는 AI 기반 앱 스토어 스팸의 가능성을 경고하는 조기 신호로 작용할 수 있다. 또한, 오픈 월드 평가는 기존 벤치마크의 한계를 극복하고 AI 시스템의 실제 능력에 대한 증거를 수집하는 데 중요한 역할을 한다.
오픈 월드 평가는 AI 시스템의 실제 적용 가능성을 평가하는 데 있어 기존 벤치마크의 한계를 보완할 수 있는 방법을 제공한다.
원문 출처
AI Snake Oil (Narayanan & Kapoor)