의료 텍스트에서 LLM 워터마크의 성능 평가
Marking the Wrong Symptoms: Evaluating LLM Watermarks in Medical Texts
대형 언어 모델(LLMs)은 임상 워크플로우에 점점 더 통합되고 있으며, 모델 생성 출력의 신뢰할 수 있는 추적 가능성을 위한 워터마킹의 필요성이 커지고 있다. 본 연구에서는 11개의 LLM과 7개의 VLM을 대상으로 5개의 워터마킹 방식을 벤치마킹하여 의료 성능에 미치는 영향을 최초로 체계적으로 조사하였다. 연구 결과, 워터마킹이 여러 실패 모드에서 상당한 성능 저하를 유발할 수 있으며, 특히 임상 텍스트에 내재된 실패를 간과할 수 있음을 보여준다. 따라서 의료 분야에서 안전한 워터마크 모델 배포를 위해서는 도메인별 평가가 필수적이다.
워터마킹이 의료 텍스트에서 심각한 성능 저하를 유발할 수 있음을 보여주며, 이는 임상적 결과에 중대한 영향을 미칠 수 있다.
원문 출처
arXiv cs.AI (인공지능)