olmo-eval: 모델 개발 루프를 위한 평가 워크벤치
olmo-eval: An evaluation workbench for the model development loop
olmo-eval은 모델 개발자가 변경되는 LLM 체크포인트에 대해 벤치마크를 추가하고 실행하며 분석할 수 있도록 돕는 오픈 평가 워크벤치이다. 이는 OLMES의 최종 점수 재현성을 일상적인 모델 개발 루프로 확장한다.
원문 출처
Allen Institute for AI (Ai2) Blog