Mitigating Modality and Language-Style Gaps for Zero-Shot Video Moment Retrieval

📄 arXiv: 2607.19027v1 📥 PDF

作者: Jihyun Lee, Cheol-Ho Cho, Woojin Jun, Woojin Jeong, Jae-Pil Heo

分类: cs.CV

发布日期: 2026-07-21

备注: ECCV 2026 (* These authors contributed equally.)


💡 一句话要点

提出自相似性基础的时刻提议与评分方法以解决零-shot视频时刻检索中的模态与语言风格差距问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 零-shot检索 视频理解 自相似性 多模态学习 时刻提议生成 语言风格差距 鲁棒性提升

📋 核心要点

  1. 核心问题:现有的零-shot视频时刻检索方法依赖于查询与视频内容的相似性,容易受到模态和语言风格差距的影响,导致不可靠的时刻提议和检索结果。
  2. 方法要点:本文提出了一种基于自相似性的时刻提议与评分方法,利用视频内容的内在关系生成稳健的时刻提议,减少了模态和语言风格的影响。
  3. 实验或效果:通过大量实验,Self-SiMS在多个ZMR基准测试中表现出色,达到了最先进的性能,验证了方法的有效性。

📝 摘要(中文)

零-shot视频时刻检索旨在克服传统方法对大规模文本标注及其相关时间跨度的依赖。尽管预训练的视觉-语言模型和多模态大语言模型取得了一定进展,现有的ZMR方法仍然过于依赖查询与视频内容的相似性,导致模态和语言风格差距,使得时刻检索结果不稳定。为了解决这一问题,本文提出了基于自相似性的时刻提议与评分方法,利用视频内部的内在关系生成稳健的时刻提议和评分。通过仅从视频内容中推导自相似性,避免了查询帧或查询标题相似性中的噪声和不匹配模式,从而减轻了模态和语言风格差距。此外,本文还引入了基于查询的多模态大语言模型推理阶段,以进一步增强文本与视频之间的对齐。大量实验表明,Self-SiMS在ZMR基准测试中达到了最先进的性能。

🔬 方法详解

问题定义:本文旨在解决零-shot视频时刻检索中的模态与语言风格差距问题。现有方法过于依赖查询与视频内容的相似性,导致时刻提议不稳定和结果不可靠。

核心思路:论文提出的核心思路是利用视频内容的自相似性来生成时刻提议和评分,避免了查询与视频之间的噪声和不匹配,从而增强了检索的鲁棒性。

技术框架:整体架构包括两个主要模块:自相似性基础的时刻提议生成模块和基于查询的多模态大语言模型推理阶段。前者负责从视频内容中提取自相似性,后者则增强文本与视频的对齐。

关键创新:最重要的技术创新在于通过自相似性生成时刻提议,避免了传统方法中查询与视频内容相似性带来的噪声和不稳定性,这一设计显著提升了检索的准确性和稳定性。

关键设计:在参数设置上,采用了特定的损失函数来优化自相似性评分,并设计了适合视频内容特征提取的网络结构,以确保生成的时刻提议具有较高的质量和准确性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在多个ZMR基准测试中,Self-SiMS方法表现出色,达到了最先进的性能,相较于现有方法,性能提升幅度显著,验证了自相似性基础方法的有效性和优势。

🎯 应用场景

该研究的潜在应用领域包括视频监控、视频检索系统和多媒体内容分析等。通过提高零-shot视频时刻检索的准确性和鲁棒性,能够在实际场景中更有效地提取和利用视频信息,具有重要的实际价值和未来影响。

📄 摘要(原文)

Zero-shot video moment retrieval aims to overcome the limitations of traditional approaches that require large-scale datasets annotated with text and its relevant temporal spans. Despite advances in pre-trained vision-language models and multimodal large language models, existing ZMR methods still heavily depend on query-to-video content similarity, making them vulnerable to modality and language-style gaps. These gaps lead to unreliable span proposals and unstable moment retrieval results. To address this issue, we propose Self-Similarity-based Moment Proposal and Scoring that instead exploits intrinsic relationships within videos, enabling robust span generation and scoring. By deriving self-similarity only from the video content, we circumvent the noisy and mismatched patterns of query-frame or query-caption similarities, thereby mitigating both modality and language-style gaps. Furthermore, we introduce a query-aware MLLM-based reasoning stage to further sharpen alignment between text and video. Extensive experiments demonstrate that Self-SiMS achieves state-of-the-art performance across ZMR benchmarks.