언어 모델에서의 언어화 가능한 표현과 글로벌 작업 공간
Verbalizable Representations Form a Global Workspace in Language Models
이 논문은 대형 언어 모델에서 인간 뇌의 기능적 구분과 유사한 기능적 구분이 나타났음을 보여준다. 새로운 해석 기법인 Jacobian lens를 사용하여 모델이 처리하는 각 시점에서 언어화할 수 있는 표현을 식별한다. 이 표현들은 J-space로 불리며, 글로벌 작업 공간의 특성을 지닌다. J-space는 중간 단계의 레이어에서 일관된 내용을 가지고, 동시에 수십 개의 개념을 보유하며, 모델의 가중치에 의해 다른 표현보다 더 널리 방송된다. 이러한 특성은 모델의 비언어적 사고를 이해하는 데 유용하다.
J-space는 언어 모델이 유지하는 소규모의 특권적 표현 집합을 나타내며, 이는 의식적 접근의 기능적 특징을 지닌다.
원문 출처
arXiv cs.CL (계산언어학·NLP)