기관 특화 LLM 프롬프트가 기존 시스템이 놓친 PHI 회복
Institution-Specific LLM Prompting Recovers PHI That De-identification Systems and Their Gold Standards Both Miss
전자 건강 기록의 이차 사용을 위해서는 비식별화가 필요하지만, 기존 시스템은 병원 약어, 건물 이름 및 내부 코드와 같은 기관적으로 위치한 보호 건강 정보(PHI)를 놓친다. 연구에서는 대형 언어 모델(LLM)과 인컨텍스트 학습(ICL)을 사용하여 이 격차를 해소하고 정밀도-재현율 간의 균형을 조정할 수 있는지를 평가했다. 텍사스 아동병원에서 수집한 100개의 소아 종양학 노트에서 8개의 LLM을 두 개의 목적 기반 시스템(Stanford TiDE, OpenMed PII) 및 두 개의 패턴 기반 기준과 비교한 결과, LLM이 목적 기반 시스템보다 우수한 성능을 보였으며, 놓친 카테고리를 명시함으로써 79%의 회복률을 기록했다. 최종 프롬프트는 0.981의 재현율을 달성했다.
LLM은 기존의 비식별화 시스템에 대한 적절하고 적응 가능한 대안으로, 기관 특화 프롬프트 개발이 주요 적응 전략이 되어야 한다.
원문 출처
arXiv cs.CL (계산언어학·NLP)