안전한 LLM을 위한 회로 기반 가중치 조정 연구
From Detection to Refusal: Safer LLMs via Circuit-Guided Weight Scaling
대규모 언어 모델(LLM)은 적대적 프롬프트에 의해 안전하지 않은 콘텐츠를 생성할 수 있는 취약성이 있으며, 안전 행동의 내부 메커니즘은 잘 이해되지 않고 있다. 본 연구에서는 LLM의 안전성을 기계적 해석 가능성 관점에서 연구하고, 거부 행동을 조직하는 다단계 '안전 회로'를 특징짓는다. 이 회로는 해로운 입력에 반응하는 '해로운 탐지 헤드', 안전 신호를 매개하고 안정화하는 '안전 뉴런', 그리고 이러한 신호를 안전한 응답 생성으로 변환하는 '거부 헤드'로 구성된다. 6개의 LLM에서 회로 기반 스케일링은 공격에 대한 안전 비율을 26.5% 향상시키면서도 4개의 표준 벤치마크에서 정확도는 1.7%만 감소하는 결과를 보였다.
회로 기반 스케일링은 공격에 대한 LLM의 안전 비율을 26.5% 향상시킨다.
원문 출처
arXiv cs.CL (계산언어학·NLP)