법률 AI의 불확실성 융합을 통한 사례 결과 예측 실험
Calibrated Trust, Not Sharper Prediction: An Empirical Test of Uncertainty Fusion
법률 AI에서 사례 결과 예측을 개선하기 위해 불확실성 도구를 융합하는 방안을 테스트하였다. 1,000개의 유럽 인권 법원 사례를 분석하여 Claude Opus 4.8과 GPT-5.5를 사용한 세 가지 접근법을 비교하였다. 결과적으로, 불확실성 융합 파이프라인은 원시 LLM이나 기준선에 비해 개선 효과가 없었고, Dempster-Shafer 융합은 잘못된 레이블에 대해 높은 신뢰도를 가지며 부정확성을 초래하였다. 최종적으로 조정된 시스템은 1,000건의 사례에서 96.8%의 정확도를 기록하였다.
원문 출처
arXiv cs.LG (머신러닝)