AI 에이전트 평가 격차: 기업들이 자율성을 부여하면서 평가 신뢰도 감소
The agent evaluation gap: Enterprise AI organizations have a reality-alignment problem, not a coverage problem — and most are shipping to production anyway
157개 기업을 대상으로 한 조사에서, 절반(50%)이 내부 평가를 통과한 AI 에이전트를 배포했으나 고객에게 실패한 경험이 있다고 보고했다. 현재 자동화된 평가를 완전히 신뢰하는 기업은 5%에 불과하며, 가장 큰 문제는 평가가 실제 결과와 잘 맞지 않는다는 것이다. 66%의 기업이 인간 개입 없이 자동화된 배포를 허용하거나 이를 위해 시스템을 개선하고 있다. 평가 도구는 분산되어 있으며, 실시간 품질 검사를 수행하는 기업은 약 25%에 불과하다.
기업의 50%가 내부 평가를 통과한 AI 기능이 고객에게 실패한 경험이 있어, 이는 평가와 실제 성능 간의 불일치를 나타낸다.
원문 출처
VentureBeat — AI