NeuronFuzz: LLM 안전 평가를 위한 안전 뉴런 유도 퍼징 프레임워크
NeuronFuzz: Safety Neuron Guided Fuzzing for LLM Safety Evaluation
NeuronFuzz는 대형 언어 모델(LLM)의 안전 평가를 위한 화이트박스 퍼징 프레임워크로, 내부 안전 뉴런을 활용하여 지속적인 실행 피드백을 제공합니다. SafetyOracle은 안전 뉴런의 활성화를 연속적인 안전 경고 점수로 변환하여 퍼징 피드백을 제공하며, 이는 응답 생성을 제거하여 효율성을 높입니다. NeuronFuzz는 21개의 텍스트 및 다중 모달 모델에서 평가되었으며, 5개의 화이트박스 소스 모델에서 76-100%의 탈옥 발견률을 기록하여 기존 방법보다 최대 48% 향상된 성과를 보였습니다.
NeuronFuzz는 21개 모델에서 76-100%의 탈옥 발견률을 달성하여 LLM의 안전성을 평가하는 데 효과적입니다.
원문 출처
arXiv cs.LG (머신러닝)