Where to Look Matters: Learning Influential Views for VLM-based 3D Visual Grounding
作者: Tsung-Chih Chiang, Hsuan-Kung Yang, Jou-Min Liu, Ting-Ru Liu, Chun-Wei Huang, Quan Kong, Chun-Yi Lee
分类: cs.CV
发布日期: 2026-09-04
备注: Accepted to ECCV 2026
💡 一句话要点
提出IVSGround以解决3D视觉定位中的视角选择问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 3D视觉定位 视觉-语言模型 影响视角选择 深度学习 机器人导航 增强现实
📋 核心要点
- 现有的零-shot 3D视觉定位方法依赖启发式规则选择视角,导致定位准确性不足。
- 本文提出IVSGround框架,通过训练视角选择器来识别提供有效证据的视角,替代固定的启发式方法。
- 实验结果显示,IVSGround在多个数据集上提升了定位准确性,验证了视角选择的重要性。
📝 摘要(中文)
近年来,零-shot 3D视觉定位方法利用视觉-语言模型(VLM)从自然语言查询中定位3D场景中的物体。然而,这些方法通常依赖启发式规则选择提供给VLM的相机视角,往往优先考虑物体的可见性而非定位的相关性。本文提出了IVSGround框架,学习影响视角选择以实现基于VLM的3D视觉定位。通过训练轻量级视角选择器,识别提供区分性证据的视角。在推理阶段,学习到的选择器为每个候选物体预测查询条件的影响视角,随后通过冻结的推理VLM进行比较定位。实验结果表明,IVSGround在ScanRefer和NR3D数据集上显著提高了定位准确性,表明选择观察的视角对有效的3D视觉定位至关重要。
🔬 方法详解
问题定义:本文旨在解决现有零-shot 3D视觉定位方法中视角选择的不足,现有方法多依赖启发式规则,导致定位效果不佳。
核心思路:IVSGround框架通过训练一个轻量级的视角选择器,识别出对定位最具影响力的视角,从而提高定位的准确性。
技术框架:该框架包含两个主要阶段:第一阶段是通过推理VLM生成训练信号,第二阶段是在推理时使用学习到的选择器为每个候选物体预测影响视角。
关键创新:IVSGround的创新在于使用学习的视角选择器替代固定的启发式方法,使得视角选择更加灵活和有效,显著提升了3D视觉定位的准确性。
关键设计:在训练过程中,采用两阶段拒绝采样生成监督信号,选择器的设计注重轻量化,以便于在推理时快速响应。
🖼️ 关键图片
📊 实验亮点
在ScanRefer和NR3D数据集上的实验结果显示,IVSGround相比现有的零-shot方法显著提高了定位准确性,具体提升幅度达到了X%(具体数据待补充),验证了影响视角选择的重要性。
🎯 应用场景
该研究在机器人导航、增强现实和自动驾驶等领域具有广泛的应用潜力。通过提高3D视觉定位的准确性,IVSGround能够增强机器人的环境理解能力,提升人机交互的自然性和流畅性,未来可能推动智能设备的普及与应用。
📄 摘要(原文)
Recent zero-shot 3D visual grounding methods leverage vision-language models (VLMs) to localize objects in 3D scenes from natural language queries. However, these methods typically rely on heuristic rules to select which camera views are provided to the VLM, often prioritizing object visibility rather than grounding relevance. We present IVSGround, a framework that learns Influential View Selection for VLM-based 3D visual grounding. Instead of using fixed heuristics, a lightweight view selector is trained to identify views that provide discriminative evidence for grounding. To obtain supervision signals, we generate training signals using feedback from a reasoning VLM through a two-stage rejection sampling process. During inference, the learned selector predicts query-conditioned influential views for each candidate object, which are then evaluated by a frozen reasoning VLM through comparative grounding. Experiments on ScanRefer and NR3D show that IVSGround consistently improves grounding accuracy over existing zero-shot pipelines, demonstrating that selecting where to look is crucial for effective 3D visual grounding. Project page: https://ivsground.github.io/