ASK+ 모델을 통한 불확실성 기반 LLM 지원 개선
ASK in the Dark: Uncertainty-Gated LLM Assistance under Partial Observability
강화 학습 에이전트는 불완전한 정보에서 행동해야 하며, 소형 언어 모델(SLM)의 지침을 통합하는 것이 어려웠다. 기존의 불확실성 기반 접근 방식은 SLM이 독립적인 행동을 거의 하지 못하는 문제를 보였고, 이는 맥락 문제로 확인되었다. ASK+는 SLM에 경로 인식 맥락과 구조화된 사고 과정을 제공하여 정책을 가끔 수정하는 더 유용한 상담자로 변환한다. ASK+는 DoorKey에서 93%의 성공률, FourRooms에서 70%, HigherLower에서 73.7%의 정확도를 기록하며, Qwen3.5-2B 모델이 Qwen3.5-4B 모델과 동등하거나 더 나은 성능을 보였다.
ASK+는 불확실성 신호를 활용하여 POMDP 환경에서도 유용한 지원을 제공할 수 있다.
원문 출처
arXiv cs.AI (인공지능)