VEGAS: Human-Aligned Video Caption Evaluation via Gaze
作者: Shenghui Chen, Po-han Li, Ximeng Sun, Shijia Yang, Emad Barsoum, Zicheng Liu, Sandeep Chinchali, Ufuk Topcu
分类: cs.CV, cs.AI, cs.HC
发布日期: 2026-07-09
💡 一句话要点
提出VEGAS以解决视频字幕与观众注意力不匹配问题
🎯 匹配领域: 支柱六:视频提取与匹配 (Video Extraction)
关键词: 视频字幕生成 观众注意力 多模态评估 信息论度量 个性化字幕
📋 核心要点
- 现有的视频字幕生成方法通常未能有效捕捉观众的个体注意力,导致生成的描述与观众的关注点不匹配。
- VEGAS通过利用测试时的注视数据,提出了一种无训练的度量标准,能够生成与观众注意力对齐的个性化字幕。
- 实验结果显示,VEGAS选择的字幕在与人类关注点的对齐度上显著提高,并且在字幕到视频的检索任务中表现出色。
📝 摘要(中文)
视觉语言模型在视频字幕生成方面表现优异,但通常生成的描述未能有效捕捉个体观众的注意力。我们提出了VEGAS(通过注视评分进行视频字幕评估),这是一种无训练的度量标准,利用测试时的注视数据来采样个性化、与注意力对齐的文本。VEGAS是一个跨模态的信息论度量,量化候选字幕与观众关注点的匹配程度。为评估VEGAS,我们策划了一个包含自我中心活动和配有同步注视及参考注释的教学幻灯片的数据集。通过拒绝采样,我们在不重新训练模型的情况下选择基于VEGAS的字幕。实验表明,VEGAS选择的字幕与人类关注点的对齐显著更好,并改善了字幕到视频的检索效果,展示了在推理过程中融入观众注意力的实际效用。
🔬 方法详解
问题定义:现有的视频字幕生成方法未能充分考虑观众的个体注意力,导致生成的字幕与观众的关注点不一致,影响了字幕的有效性和实用性。
核心思路:VEGAS通过在测试阶段利用观众的注视数据,提出了一种无训练的度量标准,能够生成与观众注意力对齐的个性化字幕,从而提升字幕的相关性和有效性。
技术框架:VEGAS的整体架构包括数据集的构建、注视数据的采集和分析、以及基于注视评分的字幕选择过程。数据集包含自我中心活动和教学幻灯片,配有同步的注视和参考注释。
关键创新:VEGAS的主要创新在于其无训练的特性和基于注视评分的个性化字幕选择方法,这与传统的依赖模型训练的字幕生成方法本质上不同。
关键设计:在设计过程中,VEGAS采用了拒绝采样的方法来选择字幕,确保所选字幕与观众的注意力高度一致,而无需对模型进行重新训练。
🖼️ 关键图片
📊 实验亮点
实验结果表明,VEGAS选择的字幕在与人类关注点的对齐度上显著提高,具体表现为在字幕到视频检索任务中,相较于基线方法,性能提升幅度达到XX%(具体数据未知),显示出其在实际应用中的有效性和优势。
🎯 应用场景
VEGAS的研究成果在视频内容生成、教育培训、在线教学等领域具有广泛的应用潜力。通过更好地对齐观众的注意力,VEGAS可以提升视频内容的可理解性和吸引力,进而改善学习效果和用户体验。未来,VEGAS还可以与其他多模态技术结合,进一步拓展其应用范围。
📄 摘要(原文)
Vision-language models excel at video captioning, yet typically generate descriptions that fail to capture individual viewers' attention. We propose VEGAS (Video caption Evaluation via GAze Score), a training-free metric that leverages test-time gaze to sample personalized, attention-aligned text. It is a cross-modal, information-theoretic metric that quantifies how well a candidate caption matches a viewer's focus. To evaluate VEGAS, we curate a dataset of egocentric activities and instructional slides paired with synchronized gaze and reference annotations. We then select captions based on VEGAS via rejection sampling without model retraining. Experiments show that VEGAS-selected captions align significantly better with human focus and improve downstream caption-to-video retrieval, demonstrating the practical utility of incorporating viewer attention during inference.