LLM의 근본적 결함으로 인한 공격 취약성
A fundamental flaw leaves LLMs strikingly vulnerable to attack
연구팀은 대규모 언어 모델(LLM)이 해킹에 대해 완전히 안전할 수 없다는 주장을 ICML에서 발표했다. 이 결함은 LLM이 지시를 받는 주체를 식별하는 방식과 관련이 있으며, 연구자들은 이를 이용해 LLM이 제공하지 않도록 훈련된 정보(예: 코카인 합성 방법)를 출력하게 만들었다. 연구자들은 이러한 공격을 '사고의 연쇄 위조'라고 부르며, OpenAI의 여러 모델에서 유사한 결과를 확인했다. LLM은 사용자의 지시와 이전 응답을 혼합하여 처리하기 때문에 공격이 효과적이다.
연구자들은 LLM이 지시를 받는 주체를 혼동하여 공격에 취약하다는 점을 강조하고, 이는 보안 시스템 설계에 중요한 고려사항이 된다.
원문 출처
MIT Technology Review — AI