LVSum: 타임스탬프 인식 긴 동영상 요약을 위한 벤치마크
LVSum: A Benchmark for Timestamp-Aware Long Video Summarization
LVSum은 긴 동영상 요약을 평가하기 위한 인간 주석 기반 벤치마크로, 72개의 다양한 동영상과 평균 16분의 길이를 가진 13개 도메인을 포함한다. 각 동영상은 최대 10개의 인간 생성 요약으로 주석이 달려 있으며, 이 요약은 시간적 참조를 포함하고 있다. LVSum은 장기간의 동영상에서 시간적 충실성을 유지하고 의미적으로 및 시간적으로 기반을 둔 요약을 생성하는 데 있어 MLLM의 도전 과제를 다룬다.
LVSum은 72개의 동영상에 대한 세밀한 시간 정렬을 제공하여 긴 동영상 요약의 평가 기준을 제시한다.
원문 출처
Apple Machine Learning Research