Subliminal Learning과 Token Entanglement에 대한 연구
Subliminal Prompting Beyond Static Geometry: Causal Depth and Multi-Token Confounds
Subliminal learning은 언어 모델이 관련이 없어 보이는 출력으로 숨겨진 특성을 전달할 수 있음을 보여준다. 연구에서는 Llama-3.1-8B에서 70B까지의 모델을 대상으로 고정된 동물-숫자 프롬프트 프로토콜을 사용하여 각 요소를 측정하였다. 고정 출력 벡터의 유사성이 행동을 예측하는 데 덜 효과적이며, AUC는 0.254에서 0.540으로 증가하였다. 이 연구는 고정 기하학, 관찰 가능성, 인과적 타이밍, 다중 토큰 측정이 서로 다른 특성임을 보여주며, 훈련 시간 특성 전이의 메커니즘을 식별하지 않는다.
Llama-3.1-8B에서 70B 모델로의 AUC 변화는 모델의 출력이 어떻게 동물 점수를 따르는지를 이해하는 데 중요한 통찰을 제공한다.
원문 출처
arXiv cs.CL (계산언어학·NLP)