강제 이주 및 FCV 문서에서 데이터셋 언급 추출을 위한 약한 감독 프레임워크
Extracting Dataset Mentions in Forced Displacement and FCV Documents: A Weakly Supervised Framework with LLM-Based Label Refinement
개발 및 인도적 조직은 연구, 정책 및 운영을 위한 데이터 자원을 지원하지만, 이러한 데이터셋이 언급된 위치를 체계적으로 식별하는 것은 어렵다. 본 연구에서는 대규모 수동 레이블링 훈련 데이터 없이 강제 이주 및 Fragile, Conflict, and Violence(FCV) 문서에 대한 데이터셋 추출을 위한 약한 감독 프레임워크를 제시한다. 일반 연구 문헌에 훈련된 경량 모델이 레이블이 없는 도메인 문서에서 후보 데이터셋 언급을 생성하고, 대형 언어 모델(LLM)이 이를 검토하여 유효성을 검증하거나 거부하며 추출 경계를 수정한다. 이 모델은 1,706개의 텍스트 구절을 포함하는 독립적인 금 표준 벤치마크에서 74.1%의 정밀도와 70.5%의 재현율을 달성하였다. 데이터셋 언급이 포함된 구절에서는 정밀도가 89.5%에 달하며, 구절 수준에서 88.2%의 정확도와 88.6%의 특이성을 기록하였다.
이 연구는 레이블이 제한된 상황에서 도메인 특화 감독을 구축하는 실용적인 접근 방식을 보여준다.
원문 출처
arXiv cs.CL (계산언어학·NLP)