AgentMemBench: 대화형 AI 에이전트의 장기 기억 관리 전략 평가를 위한 체계적 벤치마크
AgentMemBench: A Systematic Benchmark for Evaluating Long-Term Memory Management Strategies in Conversational AI Agents
AgentMemBench는 대화형 AI 에이전트의 장기 기억 관리 전략을 평가하기 위한 통합된 벤치마크로, 다섯 가지 기억 관리 전략(인-컨텍스트 윈도우링, 외부 키-값 저장소, 그래프 기반 에피소드 기억, 압축 기반 요약, 웹 증강 기억)을 동일한 조건에서 평가한다. 세 가지 공개 데이터셋(LoCoMo, MultiDoc2Dial, MSC)을 사용하여 Recall@k, MRR, nDCG@k, Answer F1, Faithfulness 점수, Memory Footprint, Latency를 측정하였다. EKV는 모든 품질 축에서 우위를 보였으며, 장기 기억 회상에서 EKV만이 높은 성능을 나타냈다.
EKV는 Recall@5에서 0.573을 기록하며, 장기 회상에서 다른 전략들보다 우수한 성능을 보인다.
원문 출처
arXiv cs.CL (계산언어학·NLP)