Diffusion Transformers에서의 아웃라이어 토큰 연구
Taming Outlier Tokens in Diffusion Transformers
Diffusion Transformers(DiTs)에서 이미지 생성을 위한 아웃라이어 토큰을 연구하였다. 이전 연구에서는 Vision Transformers(ViTs)가 제한된 지역 정보를 가지면서도 불균형한 주목을 끄는 고노름 토큰을 생성할 수 있음을 보여주었으나, 생성 모델에서의 역할은 충분히 탐구되지 않았다. 본 연구에서는 현대 Representation Autoencoder(RAE)-DiT 파이프라인의 인코더와 디노이저 모두에서 이러한 현상이 나타남을 보여주며, 사전 훈련된 ViT 인코더가 아웃라이어 표현을 생성할 수 있고, DiTs 자체에서도 특히 중간 레이어에서 내부 아웃라이어 토큰이 발생할 수 있음을 확인하였다.
Diffusion Transformers의 아웃라이어 토큰 현상은 이미지 생성 품질에 영향을 미칠 수 있다.
원문 출처
Apple Machine Learning Research