FAR.AI의 AI 보안 리더보드와 모델 안전성 평가
Is Offense or Defense Dominant? FAR.AI's Adam Gleave on the AI Security Leaderboard
FAR.AI의 공동 창립자이자 CEO인 Adam Gleave는 AI 보안 리더보드에 대해 논의하며, 이는 개발자들이 실제로 배포한 오용 방지 기능을 체계적으로 평가한 첫 번째 사례이다. Claude Fable 5와 GPT-5.6 Sol은 FAR.AI의 테스트를 통과했으나, Grok 4.5와 Gemini 3.1 Pro는 수백 개의 보편적인 jailbreak에 취약했다. Gleave는 많은 효과적인 공격이 고급 머신러닝보다 사회 공학에 가까운 이유와 'jailbreak tax'에 의존하지 말아야 하는 이유를 설명했다.
FAR.AI의 AI 보안 리더보드는 모델이 실제 공격자를 얼마나 효과적으로 방어하는지를 평가하는 중요한 도구이다.
원문 출처
The Cognitive Revolution