Qwen2.5-14B 모델, Jeopardy! 데이터셋에서 67% 정답률 기록
Time Capsule of Testable Human Knowledge: 41 Years of Jeopardy! in a Single Free Local Model
IBM의 Watson은 2011년에 인류의 지식을 쿼리할 수 있는 캡슐로 평가받았으나, 현재는 9GB의 오픈 웨이트 모델인 Qwen2.5-14B가 1984년부터 2025년까지의 Jeopardy! 클루 데이터셋 529,939개에 대해 67.0%의 정답률을 기록했다. 이 모델은 훈련 시점 이후의 질문에도 65%의 정답률을 보였으며, Watson은 0%였다. 이는 모델이 문화의 일반 지식을 포괄적으로 반영할 수 있음을 보여준다.
Qwen2.5-14B 모델은 Jeopardy! 데이터셋에서 67.0%의 정답률을 기록하여, 과거의 제한된 데이터셋에 의존하지 않고도 일반 지식에 대한 응답 능력을 보여준다.
원문 출처
arXiv cs.AI (인공지능)