LVSum: A Benchmark for Timestamp-Aware Long Video Summarization

📄 arXiv: 2604.10024 📥 PDF

作者: Alkesh Patel, Melis Ozyildirim, Ying-Chang Cheng, Ganesh Nagarajan

分类: cs.CV, cs.AI, cs.LG

发布日期: 2026-07-20


💡 一句话要点

提出LVSum基准以解决长视频摘要中的时间一致性问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 长视频摘要 时间一致性 多模态大语言模型 人类注释 内容相关性 模态一致性 视频分析

📋 核心要点

  1. 长视频摘要面临时间一致性和语义准确性等重大挑战,现有方法难以有效处理。
  2. LVSum基准通过人类注释和细粒度时间对齐,提供了评估长视频摘要的新方法。
  3. 实验表明,转录文本对摘要质量贡献显著,且现有模型在时间对齐和模态一致性方面存在不足。

📝 摘要(中文)

长视频摘要在多模态大语言模型(MLLMs)中面临重大挑战,尤其是在保持长时间段的时间一致性和生成语义及时间上都扎根的摘要方面。我们提出了LVSum,这是一个人类注释的基准,用于评估长视频摘要,并具有细粒度的时间对齐。LVSum包含72个跨越13个领域的多样化视频,平均时长为16分钟,每个视频都有多达10个包含时间参考的人类生成摘要。我们使用新引入的基于LLM的内容相关性和模态一致性指标,对领先的专有和开源MLLMs进行了全面评估,同时也使用了标准的自动化指标。实验结果显示,转录文本对摘要质量的贡献远大于单独的视觉帧,模型生成的摘要与人类撰写的摘要之间存在显著性能差距,当前的MLLMs在时间对齐、指令遵循和跨模态一致性方面表现出系统性弱点。我们发布了数据集和代码。

🔬 方法详解

问题定义:本论文旨在解决长视频摘要中时间一致性和语义准确性不足的问题。现有方法在处理长视频时,往往无法有效保持时间信息,导致生成的摘要缺乏连贯性和准确性。

核心思路:论文提出LVSum基准,通过人类注释和细粒度时间对齐,来评估和改进长视频摘要的质量。通过引入新的LLM指标,增强了对内容相关性和模态一致性的评估。

技术框架:LVSum的整体架构包括视频数据收集、注释生成、模型评估和结果分析等多个阶段。每个视频都被标注了多达10个摘要,并进行时间对齐,以便于后续的评估。

关键创新:最重要的技术创新在于引入了细粒度的时间对齐机制和新的评估指标,使得摘要生成不仅关注内容的相关性,还强调时间的一致性。这与现有方法的单一评估标准形成了鲜明对比。

关键设计:在模型评估中,采用了基于LLM的内容相关性和模态一致性指标,并结合标准自动化指标进行综合评估。实验中还考虑了转录文本与视觉帧的相对贡献,揭示了不同模态对摘要质量的影响。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,转录文本对摘要质量的贡献显著,模型生成的摘要与人类撰写的摘要之间存在显著性能差距,后者的质量普遍更高。此外,当前MLLMs在时间对齐、指令遵循和跨模态一致性方面表现出系统性弱点,提示未来研究的方向。

🎯 应用场景

该研究的潜在应用领域包括视频监控、教育视频摘要、在线课程内容提取等。通过提高长视频摘要的质量,能够帮助用户快速获取关键信息,提升信息检索效率,具有重要的实际价值和广泛的应用前景。

📄 摘要(原文)

Long video summarization presents significant challenges for multimodal large language models (MLLMs), particularly in maintaining temporal fidelity over extended durations and producing summaries that are both semantically and temporally grounded. We introduce LVSum, a human-annotated benchmark for evaluating long-form video summarization with fine-grained temporal alignment. LVSum comprises 72 diverse videos spanning 13 domains with an average duration of 16 minutes, each annotated with up to 10 human-generated summaries containing temporal references. We conduct a comprehensive evaluation of leading proprietary and open-source MLLMs using newly introduced LLM-based metrics for content relevance and modality coherence, alongside standard automatic metrics. Our experiments reveal three key findings: (1) transcripts contribute substantially more to summarization quality than visual frames alone, (2) a significant performance gap persists between model-generated and human-written summaries, and (3) current MLLMs exhibit systematic weaknesses in temporal grounding, instruction adherence, and cross-modal coherence. We release the dataset and code.