비디오 자막 품질 평가를 위한 새로운 접근법
Putting Captions to the Test: Evaluating Video Caption Quality through Multiple-Choice Question Answering
비디오 자막 품질 평가가 Visual Large Language Models (VLLMs)에서 중요한 도전 과제로 남아 있다. 기존의 평가 지표는 생성된 텍스트와 실제 참조를 비교하는 방식에 의존하며, 이는 비디오 설명의 '일대다' 특성으로 인해 고품질 자막이 어휘 불일치나 시각적 초점의 유효한 변화로 인해 불이익을 받을 수 있다. 또한, 이러한 평가 방식은 일반적으로 단일 차원적이며 자막 품질에 대한 세밀한 분석을 제공하지 못한다. 이를 해결하기 위해 자막 품질을 정보 충실도로 재정의하고, 자막이 최대한의 범위를 포괄해야 한다고 제안한다.
원문 출처
Apple Machine Learning Research