Evidence-Backed Video Question Answering

📄 arXiv: 2607.11862v1 📥 PDF

作者: Shijie Wang, Honglu Zhou, Ziyang Wang, Ran Xu, Caiming Xiong, Silvio Savarese, Chen Sun, Juan Carlos Niebles

分类: cs.CV, cs.AI

发布日期: 2026-07-13

期刊: ECCV 2026

🔗 代码/项目: GITHUB


💡 一句话要点

提出证据支持的视频问答方法以解决可解释性问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视频问答 可解释性 时空证据 像素级基础 多模态学习

📋 核心要点

  1. 现有视频问答模型缺乏可解释性,无法提供可验证的视觉证据,导致用户对答案的信任度降低。
  2. 本文提出E-VQA任务,要求模型输出语义答案及精确的时空证据,提升视频问答的可解释性。
  3. 通过在ST-Evidence-Instruct数据集上微调模型,实验结果显示在问答准确性上有显著提升,特别是在7B模型上提升了27.2 t-mean和13.8 J&F。

📝 摘要(中文)

当前的视频大型语言模型在问答任务中表现出色,但往往作为黑箱操作,提供的文本答案缺乏可验证的视觉基础。现有的可解释性努力依赖于文本推理或稀疏的边界框,难以捕捉复杂的视频动态。本文提出了证据支持的视频问答(E-VQA)任务,要求模型同时输出语义答案和精确的时空证据。为此,我们引入了ST-Evidence,这是第一个经过人工验证的基准,支持像素级的区分和生成性基础。通过对最先进模型的评估,我们发现问答准确性与真实视觉感知之间存在显著的解耦。为了解决这一问题,我们开发了可扩展的自动生成管道,创建了ST-Evidence-Instruct数据集,显著提升了基于视频的语言模型的性能。

🔬 方法详解

问题定义:本文旨在解决现有视频问答模型的可解释性不足问题,现有方法往往无法提供可靠的视觉证据,导致用户对答案的信任度降低。

核心思路:提出证据支持的视频问答(E-VQA)任务,要求模型不仅输出语义答案,还需提供精确的时空证据,包括时间段和密集的跟踪对象分割掩码,以增强可解释性。

技术框架:整体架构包括数据生成、模型训练和评估三个主要阶段。首先,通过自动生成管道创建ST-Evidence-Instruct数据集,然后对视频大型语言模型进行微调,最后评估模型在问答任务上的表现。

关键创新:引入ST-Evidence基准,支持像素级的区分和生成性基础,填补了现有方法在复杂视频动态处理上的空白。与传统方法相比,E-VQA任务强调了时空证据的重要性,提升了模型的可解释性。

关键设计:在模型训练中,采用了特定的损失函数来平衡语义答案和时空证据的输出,确保模型在生成答案时能够充分考虑视觉信息的准确性。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

实验结果表明,通过在ST-Evidence-Instruct数据集上微调,模型在问答准确性上显著提升,具体表现为7B模型在t-mean上提升了27.2,J&F上提升了13.8,建立了可解释性强的基线。

🎯 应用场景

该研究的潜在应用领域包括视频监控、自动驾驶、智能家居等场景,能够提升系统对复杂视频内容的理解和解释能力,增强用户对智能系统的信任度。未来,该方法可能推动可解释人工智能的发展,促进人机交互的自然性和安全性。

📄 摘要(原文)

Current Video Large Language Models (Video LLMs) excel in question answering (QA) but largely operate as black boxes, providing textual answers without verifiable visual grounding. Existing explainability efforts rely on textual rationales or sparse bounding boxes, which struggle to capture complex video dynamics such as occlusions and non-rigid deformations. We propose Evidence-Backed Video Question Answering (E-VQA), a novel task requiring models to jointly output a semantic answer and precise spatio-temporal evidence: temporal segments and dense, tracked object segmentation masklets. To support this, we introduce ST-Evidence, the first human-verified benchmark for both discriminative and generative pixel-level grounding. Evaluations of state-of-the-art models reveal a critical decoupling between QA accuracy and true visual perception that scaling alone fails to bridge. To address this, we develop scalable, automated generation pipelines to create ST-Evidence-Instruct, a 160k-scale dataset bridging high-level reasoning with fine-grained grounding. Fine-tuning grounded Video LLMs on this data yields substantial gains over the corresponding size-matched UniPixel baselines (e.g., +27.2 t-mean and +13.8 J&F on a 7B model), establishing a robust baseline for explainable, evidence-backed video understanding. Code and data are available at https://github.com/SalesforceAIResearch/EVQA.