법률 텍스트 데이터 처리에서 불용어 제거의 문제
Stop Removing Stopwords: How an Inherited Preprocessing Default Distorts Legal Text-as-Data
이 연구는 법률 텍스트를 데이터로 다루는 과정에서 불용어 제거가 분류 정확도에 미치는 영향을 분석한다. 7,668개의 대법원 데이터베이스 레이블과 7,001개의 판례 접근 프로젝트 의견 텍스트를 매칭하여 두 가지 이진 작업을 수행하였다. 연구 결과, 일반적으로 사용되는 불용어 목록은 모든 테스트에서 불용어를 제거하지 않은 기준선보다 낮은 성능을 보였으며, 최적화된 불용어 목록도 불용어를 제거하지 않은 것과 통계적으로 구별되지 않았다. 이 연구는 법률 텍스트 데이터 처리에서 불용어 제거가 모델이 인식하는 특징을 왜곡할 수 있음을 경고한다.
불용어 제거가 법률 텍스트의 해석 가능성을 왜곡할 수 있다는 점에서, 이 연구는 법률 데이터 처리의 신뢰성을 높이는 데 중요한 시사점을 제공한다.
원문 출처
arXiv cs.CL (계산언어학·NLP)