EvoGraph-R1: Self-Evolving Multimodal Knowledge Hypergraphs for Agentic Retrieval

📄 arXiv: 2607.12764v1 📥 PDF

作者: Jiashi Lin, Changhong Jiang, Xiangru Lin, Ruifei Zhang, Xinyi Zhu, Jiyao Liu, Cheng Tang, Ye Du, Shujian Gao, Junzhi Ning, Lihao Liu, Ziyan Huang, Tianbin Li, Jin Ye, Junjun He

分类: cs.CV

发布日期: 2026-07-14

备注: 10 pages main paper, 6 figures. CVPR 2026 accepted paper


💡 一句话要点

提出EvoGraph-R1以解决静态知识图谱在多模态检索中的局限性

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态检索 知识图谱 自我演化 马尔可夫决策过程 智能问答 动态更新

📋 核心要点

  1. 现有GraphRAG方法将知识图谱视为静态结构,导致在知识密集推理中存在多种局限性,如无法动态更新和适应新证据。
  2. EvoGraph-R1通过将知识图谱视为动态环境,利用马尔可夫决策过程(MDP)来实现检索、扩展和精炼等操作,从而支持多跳推理。
  3. 在多模态视觉问答和文本问答基准测试中,EvoGraph-R1在准确性、覆盖率和可追溯性方面显著优于现有的RAG基线。

📝 摘要(中文)

检索增强生成(RAG)已成为将多模态大语言模型(MLLMs)与外部知识结合的重要范式。现有的GraphRAG方法将知识图谱视为静态数据结构,导致在知识密集型推理中存在文本中心的碎片化、无法动态更新的结构以及单次检索的局限性。为了解决这些问题,本文提出了EvoGraph-R1,一个自我演化的GraphRAG框架,将知识图谱重新概念化为通过代理交互形成的动态环境。通过将检索过程建模为马尔可夫决策过程(MDP),该框架能够在推理过程中动态调整超图结构。实验结果表明,EvoGraph-R1在多模态视觉问答和文本问答基准上显著提升了准确性、覆盖率和可追溯性。

🔬 方法详解

问题定义:本文旨在解决现有GraphRAG方法中知识图谱作为静态数据结构的局限性,导致的推理过程中的信息碎片化和无法动态更新的问题。

核心思路:EvoGraph-R1通过将知识图谱视为动态环境,利用代理交互来不断演化图结构,从而实现更灵活的知识检索和推理。

技术框架:该框架将检索过程建模为马尔可夫决策过程(MDP),代理通过观察图状态并执行查询、扩展、精炼或终止等动作,形成一个闭环反馈机制。

关键创新:EvoGraph-R1的核心创新在于其自我演化的超图结构,能够动态整合新证据、纠正错误并优化结构,与传统静态知识图谱形成鲜明对比。

关键设计:在设计上,EvoGraph-R1采用了动态更新的超图结构,结合了多种操作(如GraphRetrieve、WebSearch、GraphEdit),并通过反馈信号指导后续的图演化过程。具体的参数设置和损失函数设计尚未详细披露。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在多模态视觉问答和文本问答基准测试中,EvoGraph-R1在准确性、覆盖率和可追溯性方面分别比现有RAG基线提高了显著的百分比,展示了其在处理复杂知识检索任务中的优势。

🎯 应用场景

EvoGraph-R1的研究成果在多模态信息检索、智能问答系统和知识图谱构建等领域具有广泛的应用潜力。通过实现动态知识更新,该框架能够提升系统的智能化水平和用户体验,未来可能在教育、医疗和金融等行业中发挥重要作用。

📄 摘要(原文)

Retrieval-augmented generation (RAG) has emerged as a critical paradigm for grounding Multimodal Large Language Models (MLLMs) in external knowledge. Recent GraphRAG methods introduce structured entity-relation graphs to improve retrieval and reasoning. However, they remain limited by treating knowledge graphs as static data structures built offline and queried in a single pass. This static paradigm misaligns with the interactive, iterative nature of knowledge-intensive reasoning, creating three bottlenecks: (i) text-centric fragmentation that impedes cross-modal reasoning, (ii) frozen structures unable to incorporate new evidence or correct errors, and (iii) rigid single-pass retrieval without adaptive refinement. To overcome these limitations, we introduce EvoGraph-R1, a self-evolving GraphRAG framework that reconceptualizes knowledge graphs as dynamic environments shaped through agent interactions. We formulate retrieval as a Markov Decision Process (MDP) where the agent observes the graph state and executes actions to query (GraphRetrieve), expand (WebSearch), refine (GraphEdit), or terminate (Answer) the reasoning. These actions reshape the hypergraph structure and generate feedback signals that guide subsequent evolution. Through this closed loop, the hypergraph evolves by integrating new evidence, correcting errors, and refining structure to support multi-hop reasoning. Experiments on multimodal VQA and text QA benchmarks demonstrate substantial improvements over existing RAG baselines in accuracy, coverage, and traceability, establishing self-evolving knowledge graphs as a fundamental paradigm across modalities.