양자화로 인한 언어 모델의 백도어 공격: 양자화 간 전이 가능성과 검증-배포 격차
Quantization-Triggered Backdoors in Language Models: Cross-Quantizer Transferability and the Validation--Deployment Gap
포스트 트레이닝 양자화는 대형 언어 모델의 엣지 배포를 위한 최적화로 여겨지지만, 전체 정밀도 소스 체크포인트를 평가하고 양자화를 적용할 때 구조적 검증-배포 격차가 발생한다. 이 연구는 양자화 행동 동등성 클래스(QBECs)를 통해 이 격차를 형식화하고, QBEC 멤버십이 행동 동등성을 보장하지 않음을 증명하여 양자화로 유도된 백도어 공격의 이론적 기초를 제공한다. 연구 결과, 백도어가 포함된 번역 모델은 FP16에서 0%의 친구-적군 오염에서 양자화 후 최대 85.02%로 증가하며, 압축 시 이념적 변화가 최대 ΔBias=0.33으로 측정된다.
양자화된 모델의 행동 인증을 위해 최종 배포 구성도 포함해야 한다는 점이 중요하다.
원문 출처
arXiv cs.LG (머신러닝)