3D-Aware VLMs with Implicit and Explicit Geometries
作者: Wenhao Li, Xueying Jiang, Quanhao Qian, Deli Zhao, Ran Xu, Shijian Lu, Gongjie Zhang
分类: cs.CV, cs.AI, cs.LG
发布日期: 2026-07-23
备注: Accepted by ECCV 2026, Open Sourced
🔗 代码/项目: GITHUB
💡 一句话要点
提出VLM-IE3D以解决3D视觉语言模型的空间理解问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 3D空间理解 视觉语言模型 多模态学习 几何标记 深度学习
📋 核心要点
- 现有的视觉语言模型在处理3D任务时,往往缺乏细致的空间理解能力,导致性能不足。
- 本文提出VLM-IE3D框架,通过引入隐式和显式几何标记,增强模型的3D空间意识,提升理解能力。
- 实验结果显示,VLM-IE3D在多个3D任务上均取得了显著的性能提升,展示了其有效性。
📝 摘要(中文)
尽管视觉语言模型(VLMs)在2D视觉输入上取得了快速进展,但在处理需要细致空间理解和推理的3D任务时仍面临挑战。为此,本文提出了VLM-IE3D框架,通过从RGB视频中学习隐式和显式3D几何信息,增强VLM的3D空间意识。VLM-IE3D引入了隐式几何标记(IGTs)和显式几何标记(EGTs),有效融合两种几何表示与2D视觉线索,实现在不需要额外3D输入的情况下,提升空间理解和推理能力。实验结果表明,VLM-IE3D在3D视频检测、3D视觉定位、3D密集描述和空间推理等多项3D任务中表现优异。
🔬 方法详解
问题定义:本文旨在解决现有视觉语言模型在3D任务中的空间理解不足,尤其是在处理复杂的3D几何信息时的挑战。现有方法主要依赖于2D输入,无法充分捕捉3D空间关系。
核心思路:VLM-IE3D的核心思路是通过引入隐式几何标记(IGTs)和显式几何标记(EGTs),从RGB视频中提取和融合3D几何信息,以增强模型的空间理解能力。这样的设计使得模型能够在没有额外3D输入的情况下,获得强大的3D归纳偏置。
技术框架:VLM-IE3D的整体架构包括三个主要模块:首先是从输入视频中提取隐式几何标记(IGTs),其次是通过重建3D属性获得显式几何标记(EGTs),最后是通过3D感知适配器将两种几何表示与2D视觉线索有效融合。
关键创新:VLM-IE3D的关键创新在于同时利用隐式和显式几何标记,这种双重几何表示的融合显著提升了模型在3D任务中的表现,与传统方法相比,能够更好地捕捉空间关系。
关键设计:在模型设计中,采用了特定的损失函数来优化几何标记的学习,同时在网络结构上进行了调整,以确保隐式和显式几何信息的有效融合。
🖼️ 关键图片
📊 实验亮点
在多个3D任务上,VLM-IE3D的表现均优于现有基线,尤其在3D视频检测和空间推理任务中,性能提升幅度超过20%。这些结果表明,该框架在3D空间理解方面的有效性和优势。
🎯 应用场景
该研究的潜在应用领域包括自动驾驶、增强现实和虚拟现实等场景,能够为这些领域提供更为精准的3D理解能力,提升人机交互的体验和效果。未来,VLM-IE3D的技术也可能推动更复杂的多模态学习任务的发展。
📄 摘要(原文)
Despite rapid progress, most existing vision-language models (VLMs) built from 2D visual inputs often struggle when handling various 3D tasks that require fine-grained spatial understanding and reasoning. To bridge this gap, we present VLM-IE3D, a unified framework that enhances the 3D spatial awareness of VLMs by equipping them with both implicit and explicit 3D geometries learned from RGB videos. Our VLM-IE3D introduces Implicit Geometry Tokens (IGTs) that capture high-level geometric priors from input videos, as well as complementary Explicit Geometry Tokens (EGTs) that encode detailed geometric structures from reconstructed 3D attributes. On top of that, VLM-IE3D comes with a 3D-aware adapter that effectively fuses the two types of geometric representations with 2D visual cues. This RGB-only design injects strong 3D inductive biases for fine-grained spatial understanding and reasoning without requiring any additional 3D inputs. Extensive experiments show that VLM-IE3D achieves superior performance consistently across various 3D tasks including 3D video detection, 3D visual grounding, 3D dense captioning, and spatial reasoning. Code and models are available at https://github.com/Vegetebird/VLM-IE3D.