Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models
作者: Zhiwei Yang, Yuanchen Wu, Nan Zhang, Yucong Meng, Ke Yan, Shouhong Ding
分类: cs.CV
发布日期: 2026-07-07
备注: ICML 2026
🔗 代码/项目: GITHUB
💡 一句话要点
提出场景图思维以增强多模态大语言模型的结构化视觉推理能力
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态大语言模型 视觉推理 场景图 结构化关系 强化学习 数据生成 图对齐训练
📋 核心要点
- 现有多模态大语言模型多关注孤立对象,忽视结构化关系,导致在视觉推理任务中的表现受限。
- 本文提出场景图思维(SaGe),通过自动化数据引擎生成结构化场景图,增强模型的视觉推理能力。
- 通过图对齐的后训练方法,本文在八个多模态基准上取得显著提升,展现了强大的细粒度感知和推理能力。
📝 摘要(中文)
多模态大语言模型(MLLMs)展现了强大的感知和推理能力,但现有模型多集中于孤立对象,忽视了结构化关系,限制了在视觉密集任务中的表现。为了解决这一挑战,本文提出了场景图思维(SaGe)这一新范式,通过显式的场景图表示实现细粒度和结构化的视觉推理。我们首先引入一个自动化数据引擎,将平面图像-文本语料库转换为结构化场景图,节点由层次实体构成,边则定义了多样的视觉关系。基于此,我们构建了12万条高质量训练数据,并引入了两阶段图对齐后训练范式,显著提升了在八个多模态基准上的表现。
🔬 方法详解
问题定义:本文旨在解决现有多模态大语言模型在视觉推理中对结构化关系的忽视,导致其在复杂视觉任务中的表现不佳。
核心思路:通过引入场景图思维(SaGe),将图像和文本数据转化为结构化的场景图,增强模型对视觉关系的理解和推理能力。
技术框架:整体流程包括自动化数据引擎生成场景图、构建高质量训练数据,以及实施两阶段的图对齐后训练,分别进行监督微调和强化微调。
关键创新:最重要的创新在于通过场景图表示实现细粒度的视觉推理,显著提升了模型在复杂任务中的表现,与传统方法相比,提供了更为系统的结构化推理能力。
关键设计:在数据生成过程中,采用层次实体作为节点,视觉关系作为边,确保场景图的丰富性;在训练阶段,设计了节点作为代理的图奖励机制,以促进有效的图探索。
🖼️ 关键图片
📊 实验亮点
在八个多模态基准测试中,本文的方法显著提升了模型的表现,尤其在细粒度感知和推理任务上,性能提升幅度达到XX%(具体数据待补充),展示了场景图思维的有效性和优势。
🎯 应用场景
该研究的潜在应用领域包括智能问答、图像理解、机器人视觉等,能够为多模态系统提供更为精准的推理能力。未来,随着模型的不断优化,可能在自动驾驶、智能监控等领域发挥重要作用,提升系统的智能化水平。
📄 摘要(原文)
Multimodal Large Language Models (MLLMs) have demonstrated strong perception and reasoning capabilities. However, most existing models focus on isolated objects and neglect structured relationships for efficient target navigation, limiting their performance on visually intensive tasks. To address this challenge, we introduce Scene Graph Thinking (SaGe), a novel paradigm that enables fine-grained and structured visual reasoning through explicit scene-graph representations. Specifically, we first introduce an automated data engine that converts flat image-text corpora into structured scene graphs, where hierarchical entities constitute the nodes and diverse visual relations define the edges. Building upon this, we construct 120K high-quality training data by sampling reasoning traces from scene graphs. Then, two-stage graph-aligned post-training paradigms are introduced, where supervised fine-tuning internalizes MLLMs with structured reasoning, and subsequent reinforcement fine-tuning proposes node-as-proxy graph rewards to consolidate efficient graph exploration. With curated data and graph-aligned training, our approach achieves significant improvements across eight multimodal benchmarks, demonstrating strong effectiveness on fine-grained perception and reasoning tasks. Code is available at https://github.com/zwyang6/SaGe.