불완전한 역설과 대형 언어 모델의 벤치마크 실패
The Imperfective Paradox Is Not Necessarily in Large Language Models: A Benchmark Failure Before a Model Failure
불완전한 역설은 조합 의미 분석의 유용한 테스트를 제공하며, 최근 연구에서는 NLI 벤치마크를 구성하고 모델들이 진행형 설명에서 완료된 목표 사건을 추론하는 경향을 보인다고 보고하였다. 연구팀은 이 벤치마크와 결론이 개념적 및 평가상의 오사양에 크게 영향을 받았음을 재검토하였고, 특히 Aspectual Reduction이 벤치마크 구성과 분석에 영향을 미친다고 밝혔다. NLI 기준에서 Group A의 76% 인스턴스는 완료를 명시적으로 배제하지 않으며, Group A와 Group C의 예시 중 각각 38%와 29%가 대안 해석을 허용한다고 판단되었다. Qwen-7B, GPT-5.4, Qwen-72B 모델을 사용한 실험은 이들 모델이 인간 주석자와 유사한 성능을 달성할 수 있음을 시사한다.
원문 출처
arXiv cs.CL (계산언어학·NLP)