GAUGE: 전문가 참조 없이 금융 모델 평가하는 벤치마크
GAUGE: Grading Agent-Built Financial Models Without a Golden Answer
GAUGE는 금융 모델을 단일 전문가 참조가 아닌 관찰된 분석가 관행에 따라 평가하는 벤치마크로, 1,001개의 공급업체 분류 분석가 작업북과 196개의 평가 작업 세트를 사용한다. 108개의 지향 쌍을 분석한 결과, 중간 단일 참조 점수는 0.33이며, 92.6%가 0.70 미만이다. 현재의 에이전트는 모델 구축에서 강하지만 평가 판단에서는 상대적으로 약하다.
GAUGE는 1,001개의 분석가 작업북과 196개의 평가 작업 세트를 활용하여 금융 모델의 평가 방식을 혁신적으로 변화시킨다.
원문 출처
arXiv cs.LG (머신러닝)