CMDR: Contextual Multimodal Document Retrieval

📄 arXiv: 2607.05927v1 📥 PDF

作者: Ryota Tanaka, Taku Hasegawa, Kyosuke Nishida

分类: cs.IR, cs.AI, cs.CL, cs.CV

发布日期: 2026-07-07

备注: Accepted by ECCV 2026; project page: https://cmdr-bench.github.io/


💡 一句话要点

提出CMDR以解决多模态文档检索中的上下文建模问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态文档检索 上下文建模 对比学习 信息检索 嵌入学习

📋 核心要点

  1. 现有的多模态文档检索方法主要依赖简单的词汇或语义匹配,无法有效利用文档的上下文信息。
  2. 本文提出CMDR-Embed框架,通过联合编码多个页面来建模文档上下文,从而生成更具上下文感知的嵌入。
  3. 实验结果显示,CMDR-Embed在检索性能上显著优于传统的非上下文嵌入方法,验证了上下文建模的重要性。

📝 摘要(中文)

多模态文档检索旨在在保留原始文档的文本和视觉内容的同时检索相关页面。然而,现有基准主要评估简单的词汇或语义匹配,大多数方法独立编码页面,忽视了文档中的上下文信息。为了解决这一挑战,本文提出了CMDR和CMDR-Bench,一个新的多模态文档检索任务和基准,要求对文档上下文进行建模。我们提出了CMDR-Embed,一个上下文多模态嵌入框架,通过联合编码多个页面并从共享上下文表示中推导页面级嵌入,明确地结合了文档上下文。此外,我们引入了CMCL,一个上下文多模态对比学习目标,有效地通过平衡上下文建模与页面级可区分性来训练CMDR-Embed。实验表明,CMDR-Embed显著优于非上下文嵌入,突显了上下文感知的多模态嵌入在推动文档检索中的重要性。

🔬 方法详解

问题定义:本文旨在解决现有多模态文档检索方法中对上下文信息建模不足的问题。现有方法通常独立处理页面,无法有效聚合跨页面的信息,导致检索效果不佳。

核心思路:论文提出CMDR-Embed框架,通过联合编码多个页面,利用共享的上下文表示来生成页面级嵌入,从而增强上下文感知能力。这样的设计使得模型能够更好地理解文档内部的关系和信息流动。

技术框架:CMDR-Embed框架包括多个主要模块:首先是文档的多页面输入,然后是上下文编码模块,接着是页面级嵌入生成模块,最后是基于上下文的检索模块。整个流程通过对比学习进行优化。

关键创新:最重要的创新在于引入了上下文多模态对比学习(CMCL)目标,该目标有效地平衡了上下文建模与页面级可区分性,提升了模型的检索能力。与传统方法相比,CMDR-Embed能够更好地捕捉文档的整体语义。

关键设计:在模型设计中,采用了共享的上下文表示来生成页面嵌入,并使用了特定的损失函数来优化上下文与页面之间的关系。此外,模型的训练过程中注重平衡上下文信息与页面特征的权重,以提高检索的准确性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,CMDR-Embed在多个基准测试中显著优于传统的非上下文嵌入方法,具体性能提升幅度达到XX%(具体数据待补充),验证了上下文感知嵌入在多模态文档检索中的有效性和必要性。

🎯 应用场景

该研究的潜在应用领域包括信息检索、文档管理和智能搜索引擎等。通过有效地建模文档上下文,CMDR能够提升用户在处理多模态文档时的检索体验,具有重要的实际价值和广泛的应用前景。未来,该方法还可以扩展到其他需要上下文理解的多模态任务中。

📄 摘要(原文)

Multimodal document retrieval aims to retrieve relevant pages while preserving both textual and visual content from the original document. However, existing benchmarks primarily evaluate simple lexical or semantic matching, and most methods encode pages independently. Consequently, they overlook the contextual information in the document required to resolve queries that aggregate information across multiple pages. In this paper, we introduce CMDR and CMDR-Bench, a new multimodal document retrieval task and benchmark that require modeling document context. To address this challenge, we propose CMDR-Embed, a contextual multimodal embedding framework that explicitly incorporates document context by jointly encoding multiple pages and deriving page-level embeddings from a shared contextual representation. Furthermore, we introduce CMCL, a contextual multimodal contrastive learning objective that effectively trains CMDR-Embed by balancing contextual modeling with page-level discriminability. Experiments demonstrate that CMDR-Embed significantly outperforms non-contextual embeddings, highlighting the importance of context-aware multimodal embeddings for advancing document retrieval.