OpenAI의 SWE-Bench Pro 감사 결과와 코딩 평가의 한계
The Sequence AI of the Week #895: OpenAI's Show Us Where Coding Evals Break
OpenAI의 SWE-Bench Pro 감사 결과, 정밀한 점수가 코딩 능력을 제대로 측정하지 못할 수 있음을 보여주었다. SWE-Bench Pro는 이전 코딩 평가의 약점을 해결하기 위해 설계되었으며, 731개 과제에서 모델 성능이 23.3%에서 80.3%로 증가했지만, OpenAI는 결과의 30%가 결함이 있다고 추정했다. 감사 결과, 200개 과제(27.4%)가 결함으로 분류되었고, 소프트웨어 엔지니어들이 평가한 결과 249개 과제(34.1%)가 결함으로 나타났다. OpenAI는 SWE-Bench Pro의 채택을 권장하지 않기로 했다.
OpenAI는 SWE-Bench Pro의 30%가 결함이 있다고 추정하며, 이는 코딩 평가의 신뢰성 문제를 제기한다.
원문 출처
TheSequence (Jesus Rodriguez)