SocioHack: AI 시스템의 사회적 해킹 테스트 벤치마크
Import AI 460: Reward hacking society, RSI data from Anthropic; and RL-based quadcopter racing
Kings College London, Fudan University, The Alan Turing Institute의 연구팀이 AI 시스템이 다양한 실제 시나리오에서 시스템을 '이기는' 방법을 학습하는 능력을 평가하는 벤치마크인 SocioHack을 개발했다. SocioHack은 72개의 샌드박스 사회적 환경으로 구성되며, 역사적, 합성적, 허구적 환경으로 나뉜다. 역사적 환경은 실제 규제에서 발견된 허점을 기반으로 하며, RL 모델이 61.25%의 회수율과 90.85%의 정밀도로 전략을 재발견할 수 있도록 한다. 합성적 환경은 인간이 작성한 샘플 환경에서 생성된 규제 취약점을 포함하고, 허구적 환경은 롤플레잉 게임에서 영감을 받아 만들어진다. AI 시스템은 이 벤치마크에서 높은 점수를 기록하고 있다.
AI 시스템이 사회적 규제를 해킹하는 능력을 평가하는 SocioHack은 개발자들이 AI의 윤리적 사용과 규제 준수에 대한 새로운 도전에 대비할 수 있도록 한다.
원문 출처
Import AI (Jack Clark)