LLM 생성 임상 시험 요약의 신뢰성 평가 및 개선
Faithful by Design: Evaluating and Improving LLM-Generated Clinical Trial Summaries for Multi-Stakeholder Audiences
대형 언어 모델(LLM)은 의료 제공자, 환자 및 지불자를 위한 임상 시험 결과 요약에 사용되지만, 허위 정보 생성 경향이 있어 위험이 크다. 이 연구는 세 가지 이해관계자 대상을 위한 LLM 생성 임상 시험 요약의 신뢰성을 측정하기 위한 벤치마크 평가 프레임워크를 소개한다. 이 프레임워크는 Aggregate Analysis of ClinicalTrials.gov 데이터베이스에서 추출한 200개의 계층화된 시험을 포함하며, 청중별 프롬프트 템플릿과 여섯 가지 차원의 신뢰성 주석 스키마를 사용하여 평가된다. GPT-4o, Claude Sonnet 4.6, Gemini 2.5 Flash의 1,800개 생성 요약에 대한 기준 측정이 설정되었고, 모든 모델에서 '지원되지 않는 주장'이 주요 실패 모드로 확인되었다. 지식 그래프를 활용한 검색 시스템이 개발되어 기준선과 비교 평가되었으며, NLI 기반 신뢰성 점수에서 통계적으로 유의미한 개선을 보였다.
GPT-4o, Claude Sonnet 4.6, Gemini 2.5 Flash 모델의 신뢰성 평가를 통해 임상 시험 요약의 품질을 개선할 수 있는 방법을 제시한다.
원문 출처
arXiv cs.CL (계산언어학·NLP)