LLM 평가 기준의 변화와 문제점
The Evolving Landscape of LLM Evaluation
최근 LLM의 성능이 평가 기준을 초과하면서, MMLU, GMS8k, HumanEval 등 소수의 기준으로 축소되었다. 그러나 이러한 기준의 신뢰성에 대한 우려가 커지고 있으며, 많은 연구자들이 모델의 직관적인 평가에 의존하고 있다. LLM은 Aquila2와 Qwen 모델을 포함하여 MATH와 GSM8k의 훈련 및 테스트 예제를 반복하는 경향이 있으며, GPT 모델은 훈련 데이터 컷오프 이전의 코딩 문제에서 더 나은 성능을 보인다. 또한, Mistral과 Phi 모델은 GSM8k와 비교해 GSM1k에서 10%의 성능 저하를 보였다.
신뢰할 수 있는 평가 기준의 부족은 LLM 개발 시 모델 성능을 객관적으로 평가하는 데 어려움을 초래한다.
원문 출처
ruder.io (Sebastian Ruder)