ConsiSpace: Learning Geometric Consistency Matters for Video Spatial Reasoning
作者: Ting Huang, Zhenyu Zhang, Wenyuan Huang, Jian Yang, Hao Tang
分类: cs.CV
发布日期: 2026-07-20
备注: ECCV 2026
💡 一句话要点
提出ConsiSpace以解决长视频空间推理中的几何一致性问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱七:动作重定向 (Motion Retargeting) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 长视频理解 空间推理 几何一致性 多模态学习 自监督学习
📋 核心要点
- 现有的多模态大语言模型在长视频空间推理中,往往无法有效整合一致的空间证据,导致推理不稳定。
- 本文提出ConsiSpace框架,通过几何一致性来组织证据,并引入后监督微调学习信号,提升推理效果。
- 在VSI-Bench、OSI-Bench和MMSI-Video-Bench三个基准上,ConsiSpace的平均得分比最强基线提升了12.6分。
📝 摘要(中文)
视频空间推理对于导航感知和长视频问答至关重要,模型需要在变化的视角下推断长时间跨度内的空间关系。然而,现有的多模态大语言模型(MLLMs)主要集中于语义,往往无法有效整合来自冗余视频观察的一致空间证据,从而导致推理效率低下或不稳定。为了解决这些问题,本文提出了ConsiSpace,一个关注几何一致性的框架,将空间一致性转化为证据组织原则和显式的后监督微调学习信号。我们构建了几何一致性记忆(GCM),包括隐式证据标记和显式几何线索,并利用高效的组织策略紧凑地保存与任务相关的空间证据。通过在监督微调后利用统一一致性自监督强化学习(UC-SSRL),我们提高了跨视角的稳定性,获得了基于答案、度量和拓扑一致性的奖励。大量实验表明,在三个空间推理基准上,ConsiSpace在最强基线基础上平均提升了12.6分。
🔬 方法详解
问题定义:本文旨在解决长视频空间推理中的几何一致性问题。现有方法往往过于依赖语义信息,导致在处理冗余视频观察时无法有效整合一致的空间证据,进而影响推理的稳定性和效率。
核心思路:ConsiSpace框架的核心思想是将空间一致性作为证据组织的原则,并将其转化为显式的学习信号。通过构建几何一致性记忆(GCM),该方法能够有效地保存与任务相关的空间证据,从而提高推理的准确性和稳定性。
技术框架:ConsiSpace的整体架构包括几个主要模块:几何一致性记忆(GCM)、证据组织策略和统一一致性自监督强化学习(UC-SSRL)。GCM用于存储隐式证据标记和显式几何线索,证据组织策略则确保空间证据的紧凑保存,UC-SSRL则在监督微调后进一步提升模型的跨视角稳定性。
关键创新:本文的关键创新在于引入几何一致性作为推理过程中的核心原则,并通过后监督微调学习信号来强化这一原则。这一设计使得模型能够更好地处理冗余信息,提升推理的稳定性和准确性。
关键设计:在模型设计中,采用了多种损失函数来平衡不同一致性奖励,包括答案一致性、度量一致性和拓扑一致性。此外,GCM的构建涉及隐式和显式信息的有效整合,以确保空间证据的高效利用。具体的网络结构和参数设置在实验部分进行了详细描述。
🖼️ 关键图片
📊 实验亮点
在VSI-Bench、OSI-Bench和MMSI-Video-Bench三个基准上,ConsiSpace的平均得分比最强基线提升了12.6分,显示出显著的性能提升。这一结果表明,几何一致性在长视频空间推理中的重要性,以及该框架在处理复杂空间关系时的有效性。
🎯 应用场景
该研究的潜在应用领域包括自动驾驶、机器人导航和长视频问答等场景。通过提升模型在复杂环境下的空间推理能力,ConsiSpace能够为这些领域提供更为可靠的智能决策支持,推动相关技术的发展和应用。未来,该框架的思路也可能扩展到其他需要空间推理的任务中。
📄 摘要(原文)
Video spatial reasoning is essential for navigation-oriented perception and long-video question answering, where models must infer spatial relations across long horizons under changing viewpoints. However, existing multimodal large language models (MLLMs) remain largely semantic-centric, and often fail to reliably aggregate consistent spatial evidence from redundant video observations, leading to inefficient or unstable reasoning. To address these issues, we propose ConsiSpace, a geometry-consistency-aware framework for geometry-sensitive video spatial reasoning that turns spatial consistency into both an evidence organization principle and an explicit post-SFT learning signal. We build a geometry-consistent memory (GCM) including implicit evidence tokens and explicit geometric cues, and leverage efficient organization strategies to compactly preserve task-related spatial evidence. Furthermore, we utilize unified consistency self-supervised reinforcement learning (UC-SSRL) after supervised fine-tuning to improve cross-view stability, with answer-, metric-, and topology-consistency rewards. Extensive experiments on three spatial-reasoning benchmarks, VSI-Bench, OSI-Bench, and MMSI-Video-Bench, show consistent gains, improving the average score by 12.6 points over the strongest baselines.