에이전틱 코딩 시스템의 하네스 효과 측정
Harness or Model? Isolating the Harness Effect in Agentic Coding with a Contamination-Controlled Private Suite
에이전틱 코딩 시스템은 언어 모델과 하네스를 결합하여 채팅 모델을 자율 소프트웨어 엔지니어로 전환한다. 256개의 저장소 및 포스트 컷오프 과제를 포함한 비공식적인 환경에서 두 모델의 성능을 비교한 결과, Opus 4.8에서는 -1.25 pp, GPT-5.5에서는 +1.25 pp의 차이를 보였다. Opus 4.8의 경우, 61개의 저장소 과제에서 9.0 pp 뒤처지고, 19개의 경연 과제에서는 23.7 pp 앞섰다. 중립 하네스의 비용은 Opus 4.8에서 해결된 과제당 1.3~1.6배, GPT-5.5에서는 1.2배로 나타났다. 이 연구는 2026년 8월 원고의 비용 수치를 수정한 것이다.
Opus 4.8의 경우, 동일 모델 대비 하네스의 성능 차이를 수치적으로 분석하여 최적의 하네스 선택에 대한 인사이트를 제공한다.
원문 출처
arXiv cs.AI (인공지능)