인간의 승인 과정에서 3분의 1의 악성 AI 코딩 요청이 통과됨
Humans in the loop miss a third of dangerous AI coding agent requests
브라우저 기반 게임에서 인간이 AI 코딩 에이전트의 요청을 승인하는 능력을 테스트한 결과, 평균적으로 악성 요청의 약 3분의 1이 승인되는 것으로 나타났다. 이 게임은 사용자가 60초 동안 가능한 많은 요청을 승인하거나 거부하도록 하며, 승인된 보안 위험과 거부된 안전 명령 모두 사용자 점수에서 차감된다. 게임의 제작자인 벨기에 소프트웨어 개발자 알렉스 워터스는 반복적인 승인 과정이 결정의 질을 저하시킬 수 있다고 설명했다.
AI 코딩 에이전트의 요청 승인 과정에서 인간의 피로도가 높아지면 악성 명령이 통과할 위험이 커진다.
원문 출처
The Register — AI/ML