VideoFlexTok: 유연한 길이의 비디오 토큰화 기술
VideoFlexTok: Flexible-Length Coarse-to-Fine Video Tokenization
Visual tokenizers는 고차원 원시 픽셀을 압축된 표현으로 변환하여 다운스트림 모델링에 사용된다. 비디오 토큰화의 일반적인 접근 방식은 비디오를 공간-시간 3D 그리드의 토큰으로 표현하는 것으로, 각 토큰은 원래 신호의 해당 지역 정보를 캡처한다. 이는 텍스트-비디오 모델과 같은 다운스트림 모델이 비디오의 복잡성에 관계없이 모든 저수준 세부 정보를 '픽셀 단위'로 예측하도록 학습해야 함을 의미한다.
원문 출처
Apple Machine Learning Research