DeepSeek V3.2를 활용한 ARC-AGI-1의 비용 효율적 추론 모델
Cost-Effective Agent Harnesses for Abstract Reasoning and Generalization on ARC-AGI-1
ARC-AGI-1에 대한 연구에서 DeepSeek V3.2라는 오픈-웨이트 모델을 사용하여, ARC-specific fine-tuning 없이도 패턴 발견과 프로그램 합성을 분리한 Explorer-Definer Pipeline을 도입하였다. 이 파이프라인은 400-task 평가 세트에서 57.50%의 pass@2를 기록하며, Reflective Orchestrator를 통해 67.25%의 pass@2를 달성하였다. 이 구조는 15.50%의 원샷 기준을 약 52포인트 향상시켰으며, 생성 기반의 성능 향상을 위한 재탐색을 통해 pass@1을 +9.81 pp 증가시켰다.
Reflective Orchestrator는 이전 가설이 실패할 경우 새로운 변환을 자율적으로 탐색하여 성능을 향상시킨다.
원문 출처
arXiv cs.AI (인공지능)