Where Appearance Fails, Geometry Recognizes: A CAD-Free 3D Shape Prior That Complements Vision Foundation Models
作者: Chenxi Tao, Seung-Kyum Choi
分类: cs.CV, cs.AI, cs.RO
发布日期: 2026-09-03
备注: 19 pages, 11 figures, 5 tables
💡 一句话要点
提出一种无CAD的3D形状先验以解决视觉模型识别问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 3D形状识别 几何信息 无CAD模型 图像特征融合 机器人视觉
📋 核心要点
- 现有方法在没有CAD模型的情况下,难以有效识别未标记的特定物体,尤其是在低纹理环境中。
- 论文提出通过短暂的物体中心扫描,结合3DGS和DINOv2特征,来恢复CAD的识别能力。
- 实验结果显示,几何信息在形状独特物体上的识别率达到0.920,明显优于图像特征的0.832,且在工业部件上也有一致的增益。
📝 摘要(中文)
在制造和服务机器人领域,识别未标记训练集中的特定物体是一项常见挑战,而传统的计算机辅助设计(CAD)模型往往不可用。二维捕获无法提供形状先验,且冻结的基础特征在几何相似、低纹理的工业部件上表现不佳。本文提出通过短暂的物体中心扫描,利用3D高斯点云重建(3DGS)和DINOv2图像特征融合,恢复CAD的识别价值。实验结果表明,在形状独特的家用物体上,几何信息的识别率显著高于仅依赖图像的结果,而在纹理缺失的工业部件上,几何信息的增益虽小但一致。该方法在部分遮挡情况下表现出更大的优势,证明了几何信息的价值。
🔬 方法详解
问题定义:本文旨在解决在没有CAD模型的情况下,如何有效识别未标记的特定物体。现有方法在低纹理和几何相似的物体上表现不佳,导致识别率低下。
核心思路:论文的核心思路是利用短暂的物体中心扫描,通过3D高斯点云重建(3DGS)生成几何信息,并与DINOv2图像特征进行融合,从而恢复CAD的识别能力。
技术框架:整体流程包括三个主要模块:首先,通过RGB-D深度图进行物体扫描;其次,利用3DGS进行点云重建;最后,将重建的几何信息与DINOv2的图像特征进行融合,以提高识别性能。
关键创新:最重要的技术创新在于提出了一种无CAD的3D形状先验,能够在几何信息不足的情况下,显著提升识别性能。这一方法与传统依赖CAD模型的方式有本质区别。
关键设计:在参数设置上,采用固定权重融合策略,损失函数设计为兼顾几何和图像特征的识别能力,网络结构则基于DINOv2进行特征提取,确保在不同光照条件下的稳定性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,在形状独特的家用物体上,几何信息的识别率达到0.920,显著高于仅依赖图像特征的0.832;在纹理缺失的工业部件上,几何信息的增益从0.560提升至0.591,证明了该方法在不同场景下的有效性和一致性。
🎯 应用场景
该研究的潜在应用领域包括制造业和服务机器人,尤其是在需要识别未标记物体的场景中。通过提供一种无CAD的几何识别方法,可以降低对昂贵CAD模型的依赖,提升工业自动化和智能服务的效率与灵活性。未来,该方法有望扩展到更多复杂环境下的物体识别任务。
📄 摘要(原文)
Recognizing specific objects onboarded without a labeled training set recurs across manufacturing and service robotics, yet the conventional renderable prior, a computer-aided-design (CAD) model, is often unavailable. Two-dimensional capture supplies no shape prior, and frozen foundation features fail on geometrically similar, low-texture industrial parts. We ask what a short object-centric scan buys for recognition beyond the captured images themselves: each object is reconstructed with 3D Gaussian Splatting (3DGS), summarized into a per-class shape prototype, and fused with frozen DINOv2 image features. First, the scan recovers the recognition value of CAD without CAD: geometry from RGB-D depth (on T-LESS), 3DGS, and CAD gives comparable recognition (tied on HOPE, within 1.6 points on T-LESS); 3DGS is only a convenient route to a point cloud. Second, the payoff is governed by how recognizable the shape is: on shape-distinctive household objects (HOPE) geometry alone reaches 0.920 versus image-only 0.832, a ceiling below which fixed-weight fusion (0.872) sits. On shape-confusable textureless industrial parts (T-LESS) the gain is modest but consistent (0.560 to 0.591 fused, above both single signals). Third, the prior is complementary, not uniformly additive: it rescues far more image failures than it breaks successes, and its benefit grows under partial occlusion. Finally, the worth lies in geometry, not rendered pixels: 3DGS renderings do not help the image side, and frozen-feature recognition is nearly lighting-invariant (within 2.5 points). The study is scoped to recognition, not the BOP pose benchmark.