대상 측 리더 적응을 통한 모델 간 메모리 전이
Cross-Model Memory Transfer via Target-Side Reader Adaptation
대형 언어 모델의 지식 활용을 개선하는 방법은 비모수적 검색과 매개변수적 적응으로 나뉜다. Engram 스타일의 해시 메모리는 외부 주소 지정 가능한 테이블에 학습된 정보를 저장하며, 이를 소형 학습 리더를 통해 소비한다. 연구 결과, 모델 간 메모리 전이에서 중요한 것은 동결된 메모리와 대상 측 리더의 정렬이다. 다운스트림 질문 응답 작업에서 이중 레이어, 네 가지 분기 리더는 동일 모델과 교차 모델 재사용 간의 격차를 거의 해소하며, 평균 점수 38.8을 달성했다. 제공자 리더가 대상 인터페이스와 직접 호환될 경우, 동결된 아티팩트는 대상 측 훈련 없이도 상당한 유용성을 제공할 수 있다.
이 연구는 Engram이 호환 가능한 리더 인터페이스에 접근할 수 있는 경우 재사용 가능한 외부 지식 아티팩트로 활용될 수 있음을 보여준다.
원문 출처
arXiv cs.CL (계산언어학·NLP)