Retrieval-Augmented Generation을 통한 공공 건강 질문 응답 개선
Healthier LLMs: Retrieval-Augmented Generation for Public Health Question Answering
대형 언어 모델(LLMs)은 의료 질문 응답 벤치마크에서 유망한 결과를 보이지만, 공공 건강 분야에서의 사용은 허위 정보와 공식 지침의 빠른 변화로 제한된다. Retrieval-Augmented Generation(RAG)은 명시적으로 유지되는 코퍼스를 기반으로 응답을 강화하여 이러한 위험을 완화한다. 연구에서는 7,929개의 질문으로 구성된 PubHealthBench를 RAG 환경으로 확장하고, 다양한 임베딩 모델과 코퍼스 변형을 통해 밀집형, 희소형, 하이브리드 검색을 비교하였다. 하이브리드 검색은 일관되게 회수 및 순위 품질을 개선하며, 검색된 맥락을 제공하면 다양한 LLM에서 다중 선택 정확도가 크게 증가한다. 또한, LLM을 평가하기 위한 기준을 도입하여 신뢰성, 완전성, 명확성 및 사실 일관성을 검증하였다.
하이브리드 검색은 공공 건강 QA의 신뢰성을 높이는 주요 요소로 작용한다.
원문 출처
arXiv cs.CL (계산언어학·NLP)