Calibrated Sparse Attention을 통한 텍스트-비디오 생성 가속화
Accelerating Text-to-Video Generation with Calibrated Sparse Attention
최근의 확산 모델은 고품질 비디오 생성을 가능하게 하지만, 느린 실행 속도가 문제이다. 이러한 모델에서 사용되는 대형 트랜스포머 기반 백본은 시공간 주의(attention)로 인해 병목 현상이 발생한다. 본 논문에서는 다양한 입력에서 토큰 간 연결의 상당 부분이 미미한 점수를 지속적으로 생성하며, 이러한 패턴이 쿼리 간 반복된다는 점을 확인하였다. 따라서 이러한 경우의 주의 계산은 결과에 거의 영향을 미치지 않고 생략할 수 있다. 이 관찰은 지역 토큰 블록 간의 연결에도 적용된다.
주목할 점은, 이 연구가 비디오 생성 모델의 실행 속도를 개선할 수 있는 방법을 제시하고 있다는 것이다.
원문 출처
Apple Machine Learning Research