MERIT: LLM 에이전트를 위한 장기 기억 평가 벤치마크
When Does Memory Help? A Cost-Aware Evaluation of Long-Term Memory in Tool-Using LLM Agents
LLM 에이전트의 장기 기억을 평가하기 위해 MERIT(Memory Evaluation for Realistic Instrumented Tasks)라는 벤치마크가 제안되었다. MERIT는 세 가지 도메인에서 에피소드 도구 사용 작업을 제공하며, 이전 에피소드 사실에 대한 의존성을 자동화된 누수 점검으로 검증한다. 23,440개의 에피소드에서 메모리가 의존 작업 성공률을 0.00에서 0.55-1.00으로 향상시키는 것으로 나타났다. 업데이트된 사실에 대한 임베딩 검색은 모델 간에 0.30-0.95로 불안정하며, 에이전트는 올바르게 검색된 값을 55%의 확률로만 사용한다. 메모리 구현을 교체하면 작업 성공률이 최대 60포인트까지 변화할 수 있다.
원문 출처
arXiv cs.AI (인공지능)