TAP-RAG: Task-Aware Policy Control for Long-Document Multimodal Question Answering

📄 arXiv: 2607.18917v1 📥 PDF

作者: Zhong Ji, Keqi Jin, Yan Zhang, Jiasheng Li

分类: cs.CV

发布日期: 2026-07-21

备注: 18 pages, 6 figures, 9 tables


💡 一句话要点

提出TAP-RAG以解决长文档多模态问答中的证据使用问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 长文档问答 多模态融合 任务感知 策略控制 证据使用

📋 核心要点

  1. 现有多模态问答系统在处理长文档时,往往采用查询无关的证据使用策略,导致效果不佳。
  2. TAP-RAG通过任务感知策略控制器(TAPC)和两个证据执行器,针对不同查询动态调整证据使用策略。
  3. 在DocBench和MMLongBench-Doc上,TAP-RAG的准确率分别提升了9.1和4.5个百分点,表现优于对比基线。

📝 摘要(中文)

长文档多模态问答不仅需要从大文档中检索相关片段,还需根据不同查询采取不同的证据行为。现有的多模态RAG系统在证据访问上有所改进,但通常采用查询无关的证据使用策略。本文提出了TAP-RAG,一个任务感知的策略控制RAG框架,包含任务感知策略控制器(TAPC)和两个策略引导的证据执行器:任务感知查询引导流扩散(TA-QFD)和任务感知视觉增强(TAVE)。TAPC根据查询预测任务优先级,评估视觉/局部/全局证据信号,并生成可执行策略。TA-QFD扩展文本和结构证据,而TAVE在需要视觉或布局证据时选择性检查页面图像。最终合成阶段融合文本、视觉和结构证据,并在支持不足时选择不执行。TAP-RAG在DocBench和MMLongBench-Doc上实现了最佳准确率,较基线提升显著。

🔬 方法详解

问题定义:长文档多模态问答面临的挑战在于如何有效利用不同类型的证据来回答特定查询。现有方法往往缺乏针对性,导致信息检索和使用效率低下。

核心思路:TAP-RAG通过引入任务感知策略控制器(TAPC),根据查询的特点动态生成证据使用策略,从而提高问答的准确性和效率。

技术框架:TAP-RAG的整体架构包括三个主要模块:任务感知策略控制器(TAPC)、任务感知查询引导流扩散(TA-QFD)和任务感知视觉增强(TAVE)。TAPC负责预测任务优先级并生成策略,TA-QFD扩展文本和结构证据,TAVE则在需要时检查视觉证据。

关键创新:TAP-RAG的创新在于其任务感知的策略控制机制,能够根据查询动态调整证据使用方式,与传统的查询无关策略形成鲜明对比。

关键设计:在设计中,TAPC通过评估视觉、局部和全局证据信号来生成策略,TA-QFD和TAVE则分别针对文本和视觉证据进行优化处理,确保信息的有效融合。实验中使用的损失函数和网络结构均经过精心设计,以提升模型的整体性能。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

TAP-RAG在DocBench和MMLongBench-Doc上分别实现了61.1到70.2和42.2到46.7的准确率,较基线系统分别提升了9.1和4.5个百分点,显示出显著的性能优势。

🎯 应用场景

TAP-RAG的研究成果在多个领域具有广泛的应用潜力,包括智能问答系统、信息检索、教育技术等。通过提高长文档的问答准确性,该技术能够帮助用户更高效地获取信息,提升学习和工作效率。未来,随着多模态数据的不断增加,TAP-RAG的应用前景将更加广阔。

📄 摘要(原文)

Long-document multimodal question answering requires more than retrieving relevant chunks from a large document. Different queries require different evidence behavior. Existing multimodal RAG systems improve evidence access through text chunks, page images, graph links, or heterogeneous document elements, but they often apply a largely query-agnostic evidence-use strategy. We present TAP-RAG, a task-aware policy-controlled RAG framework for long-document multimodal QA. TAP-RAG contains a main controller, the Task-Aware Policy Controller (TAPC), and two policy-guided evidence executors: Task-Aware Query-Guided Flow Diffusion (TA-QFD) and Task-Aware Visual Enhancement (TAVE). For each query, TAPC predicts the task prior, estimates visual/local/global evidence signals, and produces an executable policy. TA-QFD then expands textual and structural evidence over the multimodal document graph, while TAVE selectively inspects page images when visual or layout evidence is needed. A guarded synthesis stage fuses text, visual, and structural evidence and abstains when support is insufficient. On DocBench and MMLongBench-Doc, TAP-RAG achieves the best overall accuracy among the compared systems, improving over a matched multimodal-RAG baseline by +9.1 points (61.1 to 70.2) and +4.5 points (42.2 to 46.7), respectively.