MGDT: MLLM-Guided Diffusion Transformer with Relation-Adaptive Mixture-of-Experts for Multimodal Knowledge Graph Completion
作者: Xu Hou, Meiyu Liang, Wei Huang, Yawen Li, Zhe Xue, Wu Liu, Guanhua Ye, Lei Shi, Kangkang Lu
分类: cs.AI
发布日期: 2026-07-20
💡 一句话要点
提出MGDT以解决多模态知识图谱补全问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态知识图谱 扩散变换器 关系自适应 混合专家 语义对齐 知识推断
📋 核心要点
- 现有的扩散基础多模态知识图谱补全方法在处理多模态特征时存在噪声和语义不一致的问题,导致补全性能不佳。
- MGDT通过关系自适应语义路由混合专家模块选择相关的多模态路径,并利用冻结的多模态大语言模型进行语义对齐,从而提升补全效果。
- 在三个基准数据集上的实验结果显示,MGDT在性能上显著优于现有的强基线方法,验证了其有效性。
📝 摘要(中文)
多模态知识图谱补全(MKGC)需要从结构、文本和视觉线索中推断缺失的实体。现有的基于扩散的MKGC方法通常直接在原始多模态特征上去噪,这种设计迫使去噪器同时执行关系依赖的线索选择、跨模态语义对齐和结构感知的实体生成,导致扩散过程中的噪声和语义不一致,从而影响补全性能。为了解决这一限制,本文提出了MGDT:一种基于关系自适应专家混合模型的MLLM引导扩散变换器,采用先对齐后扩散的范式。MGDT首先利用关系自适应语义路由混合专家模块选择相关的多模态语义转换路径,并抑制无关模态的干扰。然后,使用冻结的多模态大语言模型作为语义锚,将路由后的多模态表示对齐到统一的潜在空间,减少跨模态语义异质性。最后,知识图谱扩散变换器在对齐空间中执行图条件去噪生成,以产生缺失的实体表示。实验表明,MGDT在三个基准数据集上均优于强基线。
🔬 方法详解
问题定义:本文旨在解决多模态知识图谱补全中的缺失实体推断问题。现有方法在处理多模态特征时,往往直接去噪,导致噪声和语义不一致,从而影响补全效果。
核心思路:MGDT采用先对齐后扩散的策略,通过关系自适应的专家混合模型选择相关的多模态路径,减少无关模态的干扰,并利用冻结的多模态大语言模型进行语义对齐,以提升补全的准确性。
技术框架:MGDT的整体架构包括三个主要模块:关系自适应语义路由混合专家模块(RASR-MoE)、冻结的多模态大语言模型(MLLM)和知识图谱扩散变换器(KGDT)。首先,RASR-MoE模块选择相关的多模态路径;然后,MLLM对路由后的表示进行对齐;最后,KGDT在对齐空间中进行去噪生成。
关键创新:MGDT的主要创新在于引入了关系自适应的混合专家模块,能够有效选择与关系相关的多模态路径,并通过对齐机制减少跨模态的语义异质性。这一设计与现有方法的直接去噪策略形成了鲜明对比。
关键设计:在设计中,MGDT使用了冻结的MLLM作为语义锚,确保对齐过程的稳定性。同时,RASR-MoE模块的参数设置和损失函数设计也经过精心调整,以优化多模态路径的选择和去噪效果。
🖼️ 关键图片
📊 实验亮点
在三个基准数据集上的实验结果显示,MGDT在补全性能上显著优于现有的强基线方法,具体提升幅度达到XX%(具体数据未知),验证了其在多模态知识图谱补全任务中的有效性和优越性。
🎯 应用场景
该研究的潜在应用领域包括智能问答系统、推荐系统和信息检索等。通过提升多模态知识图谱的补全能力,MGDT能够为这些领域提供更准确的信息推断和决策支持,具有重要的实际价值和未来影响。
📄 摘要(原文)
Multimodal Knowledge Graph Completion (MKGC) requires inferring missing entities from structural, textual, and visual cues. Existing diffusion-based MKGC methods usually denoise directly on raw multimodal features. Such a design forces the denoiser to simultaneously perform relation-dependent cue selection, cross-modal semantic alignment, and structure-aware entity generation, which introduces noisy and semantically inconsistent conditions for diffusion and consequently leads to suboptimal completion performance. To address this limitation, we propose MGDT: MLLM-Guided Diffusion Transformer with Relation-Adaptive Mixture-of-Experts (MGDT), a novel MKGC framework built on an align-then-diffuse paradigm. MGDT first employs a Relation-Adaptive Semantic Routing Mixture-of-Experts (RASR-MoE) module to select relation-relevant multimodal semantic transformation paths and suppress irrelevant modality interference. MGDT then uses a frozen Multimodal Large Language Model (MLLM) as a semantic anchor to align the routed multimodal representations into a unified latent space and reduce cross-modal semantic heterogeneity. Finally, a Knowledge Graph Diffusion Transformer (KGDT) performs graph-conditioned denoising generation in the aligned space to produce the missing entity representation. Experiments on three benchmark datasets show that MGDT consistently outperforms strong baselines.