대규모 언어 모델에 대한 적대적 공격
Adversarial Attacks on LLMs
ChatGPT의 출시로 대규모 언어 모델의 사용이 가속화되었다. OpenAI 팀은 모델의 안전한 행동을 보장하기 위해 많은 노력을 기울였으나, 적대적 공격이나 탈옥 프롬프트가 모델이 원치 않는 출력을 하도록 유도할 수 있다. 이미지에 대한 적대적 공격 연구는 많지만, 텍스트와 같은 이산 데이터에 대한 공격은 직접적인 기울기 신호 부족으로 인해 더 도전적이다.
대규모 언어 모델의 안전성을 확보하기 위한 연구와 개발이 필요하다.
원문 출처
Lil'Log (Lilian Weng)