정신 건강 지원을 위한 대규모 언어 모델의 안전성 확보 기준 제안
Alignment Plausibility: A New Standard for Assuring AI in Healthcare
대규모 언어 모델(LLM)은 정신 건강 지원에 중요한 역할을 하고 있으나, 상업적 목표가 지속적인 참여를 선호하여 효과적인 심리적 지원에 필요한 마찰을 간과하고 있다. 개발자의 안전 대응은 주로 가시적이고 급성의 피해를 다루는 데 집중되어 있으며, 의존성, 경계 침식, 왜곡된 신념의 증폭과 같은 장기적인 위험 패턴은 덜 주목받고 있다. LLM을 구조적으로 안전하게 만들기 위해서는 임상 실습의 안전성을 보장하는 사회적 방식과 유사한 세 가지 수준의 정렬이 필요하다: 1) 임상 실습의 규범적 약속에 기반한 명시적 가치 명세, 2) 모델에 이러한 가치를 내재화하는 훈련, 3) 배포 중 드리프트 및 장기적 피해를 감지하는 감독. 이러한 정렬을 통해 '정렬 가능성(alignment plausibility)'이라는 개념을 제안하며, 이는 AI의 긍정적 건강 결과와 안전성을 주장할 수 있는 원칙적인 방법이다.
정렬 가능성은 AI 시스템이 긍정적 건강 결과에 맞춰 안전하게 운영될 수 있도록 하는 규제적 개념이다.
원문 출처
arXiv cs.AI (인공지능)