SageMath와 LLM 에이전트를 활용한 수학 문제 해결 평가
Evaluating SageMath-Augmented LLM Agents for Computational and Experimental Mathematics
최근 AI 수학 분야에서는 자동 형식화와 정리 증명에 초점을 맞추고 있으며, 컴퓨터 대수 시스템(CAS)의 역할은 충분히 탐구되지 않았다. 본 연구에서는 LLM 추론과 SageMath의 검증 가능한 피드백을 결합한 ReAct 스타일의 에이전트 설정을 제안하고, 이를 통해 RealMath 벤치마크의 연구 수준 수학 문제를 해결하는 성능을 평가하였다. SageMath 접근을 통해 모든 평가 모델에서 평균 9.7%의 성능 향상이 있었으며, Qwen 3.7-Max는 SageMath의 혜택을 가장 많이 받았고, GPT-5.5는 75.2%의 해결률과 가장 낮은 토큰 사용량을 기록하였다. 이 연구는 CAS가 보강된 에이전트가 수학자들의 계산 탐색을 지원하는 유망한 방향임을 제시한다.
SageMath 접근을 통해 모든 평가 모델에서 평균 9.7%의 성능 향상이 있었다.
원문 출처
arXiv cs.AI (인공지능)