Internalized Visual Thinking(IVT) 도입으로 비디오 추론 최적화
Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning
다중 모달 대형 언어 모델은 공간적, 시간적, 구체적 환경에 대한 추론을 위해 시각적 사고 체인(Visual CoT)을 점점 더 많이 사용하고 있다. Visual CoT는 중간 추론 이미지를 생성하여 시각적 예측을 위한 직관적인 메커니즘을 제공하지만, 이는 상당한 추론 오버헤드를 초래하여 비디오 추론에 문제를 일으킨다. 본 연구에서는 모델이 훈련 중 시각적으로 사고하도록 학습할 수 있는지 여부를 탐구하며, 텍스트 예측과 비디오 추론을 동시에 최적화하는 Internalized Visual Thinking(IVT)이라는 포스트 훈련 프레임워크를 소개한다.
Internalized Visual Thinking(IVT)은 비디오 추론의 효율성을 높일 수 있는 새로운 방법론을 제시한다.
원문 출처
Apple Machine Learning Research