BBOWP-Bench: 블랙박스 최적화 문제에 대한 LLM 평가
BBOWP-Bench: Evaluating LLMs on Black-Box Optimization Word Problems
이 논문은 블랙박스 최적화 문제(BBO)에서 자연어 설명을 기반으로 검색 공간과 최적화 알고리즘을 추론해야 하는 새로운 문제 설정인 BBOWP를 소개한다. BBOWP-Bench라는 데이터셋과 평가 프레임워크를 통해 자연어 문제 설명, 실행 가능한 평가 환경, 인간 설계 기준 공식을 결합한 인스턴스를 제공한다. 이 벤치마크를 사용하여 LLM의 첫 평가를 수행하였고, 현재 LLM이 주어진 평가 예산에 따라 적절한 알고리즘을 선택할 수 있지만, 문제 설명이 덜 정보적이거나 검색 공간이 문제 특정적일 경우 검색 공간 설계에 어려움을 겪는다는 것을 보여준다.
BBOWP-Bench는 LLM이 블랙박스 최적화 문제를 해결하는 데 필요한 검색 공간 설계와 알고리즘 선택을 평가할 수 있는 기준을 제공한다.
원문 출처
arXiv cs.CL (계산언어학·NLP)