FinProBench: 전문 금융 업무에 기반한 AI 에이전트 평가 기준
FinProBench: Evaluating Financial AI Agents with Role-Grounded Rubrics Derived from Professional Deliverables
FinProBench는 실제 전문 금융 업무에 맞춘 AI 에이전트 평가를 위한 벤치마크로, Role-Grounded Rubric Construction (RGRC)이라는 재사용 가능한 파이프라인을 통해 실무자가 만든 결과물에서 기준을 도출한다. RGRC는 결과물 수집, 역량 추출, 기준 합성 및 검증의 네 단계로 구성된다. 57개 직업을 30개의 전통적 역할과 27개의 역할 전문화된 역할로 분류하였으며, RGRC는 전통적 역할에서 90.7%, 역할 전문화된 역할에서 99.1%의 성능을 보인다. FinProBench는 1,723개의 결과물로 구성되어 있으며, 20개 역할에 대한 20개의 완전한 작업의 초기 평가 세트를 제공한다.
RGRC는 역할 수준에서 기준을 재사용하여 각 기준을 처음부터 작성하는 것에 비해 작업당 추정 노력을 6.7배 줄인다.
원문 출처
arXiv cs.AI (인공지능)