Search-G1: 표현 기반 내재적 보상 프레임워크
Search-G1: Grounded Search Agents via Representation-Based Intrinsic Rewards
Search-G1은 에이전트의 답변의 운영적 기초를 측정하는 표현 기반 내재적 보상 프레임워크로, 두 가지 개입 조정된 읽기를 통해 작동한다. 이 프레임워크는 검색 기반 질문-답변 벤치마크에서 실험을 통해 검색 비용과 기초의 균형을 개선하며, 경쟁력 있는 작업 정확도로 짧은 응답 경로를 생성한다. 코드가 GitHub에 공개되어 있다.
Search-G1은 정책 최적화 과정에서 프로세스 주석이나 LLM 판단 추론 없이 보상 점수를 요구한다.
원문 출처
arXiv cs.CL (계산언어학·NLP)