LLM에서의 긴 수평 상태 추적: MD5를 통한 도구 호출의 종속적 연속 실행
Long-Horizon State Tracking in LLMs: Executing MD5 through a Deep Sequence of Dependent Tool Calls
긴 수평 작업은 대형 언어 모델(LLM) 평가에서 드물며, 각 단계가 이전 단계에 의존할 때 정확도가 급격히 감소하는 문제가 있다. 이 연구에서는 모델이 MD5 해시를 단계별로 계산하도록 하여 196회의 종속적 도구 호출을 수행하고, 32비트 단어(a, b, c, d)를 각 호출 간에 유지하는 방식으로 상태 추적 능력을 테스트하였다. gpt-oss-120b 모델은 모든 호출에서 상태를 유지하며 대부분의 실행에서 올바른 해시를 반환하였다.
gpt-oss-120b 모델은 196회의 호출에서 전체 상태를 유지하며 올바른 해시를 반환하는데 성공하였다.
원문 출처
arXiv cs.AI (인공지능)