동일 데이터로 훈련된 TopK SAE의 특징 학습 차이
SAEs trained on the same data don’t learn the same features
두 개의 TopK SAE가 동일한 데이터와 배치 순서로 훈련되었지만 서로 다른 무작위 초기화를 사용했을 때, 첫 번째 SAE의 많은 잠재 변수는 두 번째 SAE와 밀접한 대응이 없으며, 그 반대의 경우도 마찬가지이다. 실제로 약 53%의 특징만이 공유된다. 또한, 공유되지 않는 많은 잠재 변수는 해석 가능하다. 좁은 SAE일수록 무작위 초기화 간의 특징 중복이 더 높으며, SAE의 크기가 증가할수록 중복이 감소한다.
SAE의 크기와 구조에 따라 특징 학습의 일관성이 달라질 수 있음을 보여주어, 모델 설계 시 초기화 방법과 크기를 고려해야 함을 시사한다.
원문 출처
EleutherAI Blog