SWE-bench, 2024년 소프트웨어 엔지니어링 작업 측정
SWE-Bench authors reflect on the state of LLM agents at Neurips 2024
SWE-bench 작업은 AI 에이전트를 GitHub 이슈 수준의 소프트웨어 엔지니어링 작업에서 측정한다. 2024년 소프트웨어 엔지니어링 작업을 다루는 에이전트의 진행 상황을 측정하는 중요한 작업 중 하나였다. Ofir Press와 Carlos E. Jimenez 두 창립자와의 인터뷰를 통해 LLM 기반 에이전트의 현황에 대한 아이디어를 공유했다.
SWE-bench는 AI 에이전트의 소프트웨어 엔지니어링 작업 처리 능력을 평가하는 기준을 제공한다.
원문 출처
Language Models & Co. (Jay Alammar)