AI 평가에서의 프로젝트 가능성 문제
When benchmark inferences do not compose: Projectibility in AI evaluation
AI 벤치마크 결과는 일반적으로 단일 단계에서 중요한 주장을 도출하지 못하며, 평가자는 이를 다른 사례로 일반화하고 능력의 증거로 해석한다. 이 논문은 보증된 연결이 자동으로 보증된 연쇄를 형성하지 않는다는 문제를 제기하며, 관찰된 사례에서 관찰되지 않은 사례로의 확장이 정당한지를 논의한다. 또한, 인접한 투영에 대한 지원이 그들의 조합을 정당화하려면 끝점과 가정이 일치해야 한다고 주장한다. 법률 연구 사례를 통해 벤치마크 증거와 배포 연구가 각각 타당할 수 있지만 병렬적으로 유지될 수 있음을 보여준다.
이 논문은 벤치마크에서 사용으로의 주장을 진단하는 프로젝트 가능성 감사의 필요성을 강조한다.
원문 출처
arXiv cs.AI (인공지능)