CLEF 2026 CheckThat! Task 2의 LLM 기반 수치 주장 검증 시스템
DS@GT ARC at CheckThat! 2026: LLM-Based Trace Ranking and Grouped Reward Modeling for Multilingual Numerical Claim Verification
이 논문은 CLEF 2026 CheckThat! Task 2를 위한 시스템을 설명하며, 대형 언어 모델(LLM)을 사용해 영어와 아랍어의 수치 주장을 검증하는 방법을 다룬다. 첫 번째 접근법은 LoRA를 사용해 LLM 기반 검증기를 미세 조정하고, 각 추론 경로를 독립적으로 이진 분류 문제로 점수화한 후 Best-of-N 선택을 통해 최종 판결을 결정한다. 두 번째 접근법은 경량 TF-IDF 보상 모델을 사용해 수치 및 시간적 중첩 특성을 수작업으로 추가하고, 판결 그룹별로 점수를 집계해 최종 예측을 한다. 아랍어에 대해서는 일반 다국어 모델과 아랍어 텍스트로 사전 훈련된 AraBERT를 비교한 결과, LLM 기반 접근법이 대부분의 지표에서 더 우수한 성능을 보였다.
LLM 기반 접근법이 Recall@5에서 경량 보상 모델보다 우수한 성능을 보였다.
원문 출처
arXiv cs.CL (계산언어학·NLP)