다중 에이전트 수학 추론에서 검토자의 정확도가 비판 수용을 보장하지 않음
Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning
많은 수학 및 과학 지향 에이전트 시스템은 전담 검토 단계가 잘못된 후보를 올바른 후보로 전환하는 데 도움이 될 것이라고 가정하고 계층적 설계를 사용한다. 4,181개의 검증자 기반 Omni-MATH 문제를 사용하여 이 가정을 테스트한 결과, 협업은 가장 쉬운 수준에서는 큰 효과를 보이지 않지만, 4단계 이후에는 방송 스타일의 동료 토론이 계획-실행-검토(PER) 파이프라인보다 더 높은 최종 정확도를 달성하는 것으로 나타났다. PER의 검토자는 방송의 검토자보다 더 높은 정확도(0.861 vs. 0.644)를 보였지만, 유용한 비판이 다음 후보를 변경할 가능성은 낮았고, 검토자 주도의 수정을 생성하는 데도 낮은 결과를 보였다. 이러한 결과는 검토자 탐지 품질과 비판 수용이 경험적으로 분리 가능함을 보여준다.
PER의 검토자는 0.861의 정확도를 보이지만, 비판 수용이 다음 후보를 변경하는 데 미치는 영향이 적어 시스템의 문제 해결 능력에 한계를 나타낸다.
원문 출처
arXiv cs.AI (인공지능)