SUFLECA: Scaling Up Feature Learning for CAD-to-image Alignment
作者: Saad Ejaz, Miguel Fernandez-Cortizas, Javier Civera, Holger Voos, Jose Luis Sanchez-Lopez
分类: cs.CV, cs.RO
发布日期: 2026-07-16
🔗 代码/项目: GITHUB
💡 一句话要点
提出SUFLECA以解决CAD与图像对齐问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: CAD对齐 几何特征学习 弱监督学习 机器人技术 增强现实 图像处理
📋 核心要点
- 现有的零-shot CAD对齐方法通常依赖于外观特征,导致在遮挡和域转移情况下性能下降。
- SUFLECA通过弱监督学习几何基础特征,并引入几何一致的匹配算法,提升了CAD与图像的对齐精度。
- 在ScanNet25k数据集上,SUFLECA的类别和实例准确率分别达到33.4%和42.3%,超越了最强的零-shot基线,且首次超过完全监督的方法。
📝 摘要(中文)
CAD与图像对齐旨在从单张RGB图像中估计物体的9D姿态(旋转、平移和各向异性缩放),为机器人技术和增强现实应用提供支持。现有的零-shot方法通常依赖外观驱动的视觉基础模型进行匹配,但在遮挡或仿真与现实域转移时表现不佳。为了解决这些问题,本文提出了SUFLECA(Scaling Up Feature LEarning for CAD Alignment),一个弱监督框架,具有两个关键贡献:首先,通过对674K图像进行归一化物体坐标(NOCs)监督,SUFLECA扩展了几何基础特征学习,学习到跨域的紧凑几何感知特征;其次,提出了一种几何一致的匹配算法,建立可靠的一对一CAD与图像对应关系。这些贡献使得每个物体实例的对齐准确且在亚秒内完成,无需迭代姿态优化。
🔬 方法详解
问题定义:本文旨在解决从单张RGB图像中准确估计物体9D姿态的问题。现有方法在遮挡和仿真与现实的域转移时表现不佳,导致对齐精度下降。
核心思路:SUFLECA通过弱监督学习几何基础特征,结合几何一致的匹配算法,旨在提高CAD与图像的对齐精度和鲁棒性。该设计使得模型能够在多种数据集上泛化,克服了传统方法的局限性。
技术框架:SUFLECA的整体架构包括两个主要模块:几何基础特征学习模块和几何一致匹配模块。前者通过对大规模图像数据集进行NOCs监督来学习几何感知特征,后者则负责建立CAD与图像之间的可靠对应关系。
关键创新:SUFLECA的主要创新在于引入了几何基础特征学习和几何一致的匹配算法,这与现有方法的外观驱动特征匹配形成鲜明对比,显著提升了对齐的准确性和效率。
关键设计:在特征学习中,使用了归一化物体坐标(NOCs)作为监督信号,确保学习到的特征具有几何感知能力。同时,匹配算法通过几何一致性约束,确保了CAD与图像之间的对应关系的可靠性。
🖼️ 关键图片
📊 实验亮点
在ScanNet25k数据集上,SUFLECA实现了33.4%的类别准确率和42.3%的实例准确率,分别比最强的零-shot基线提高了10.3和12.2个百分点。此外,SUFLECA首次在该基准上超越了完全监督的方法,展示了其强大的性能和较小的计算开销。
🎯 应用场景
SUFLECA的研究成果在机器人技术和增强现实等领域具有广泛的应用潜力。通过准确的CAD与图像对齐,能够提升机器人在复杂环境中的导航和操作能力,同时也为增强现实应用提供更为精准的虚拟物体叠加,增强用户体验。未来,该技术有望在自动驾驶、智能制造等领域发挥重要作用。
📄 摘要(原文)
CAD-to-image alignment aims to estimate an object's 9D pose (rotation, translation, and anisotropic scale) from a single RGB image, enabling applications in robotics and augmented reality. Recent zero-shot methods use visual foundation models to match image regions to CAD models, yet typically their correspondences are appearance-driven and degrade under occlusion or sim-to-real domain shift. To address these limitations, we introduce SUFLECA (Scaling Up Feature LEarning for CAD Alignment), a weakly-supervised framework for zero-shot CAD alignment with two key contributions. First, SUFLECA scales up geometry-grounded feature learning from pretrained visual representations through Normalized Object Coordinates (NOCs) supervision on 674K images spanning 12 real and synthetic datasets, learning compact geometry-aware features that generalize across domains. Second, we propose a geometrically consistent matching algorithm that establishes reliable one-to-one CAD-to-image correspondences. Together, these contributions enable accurate, sub-second alignment per object instance without iterative pose refinement. On ScanNet25k, SUFLECA achieves 33.4%/42.3% category/instance accuracy, outperforming, with a smaller computational footprint, the strongest zero-shot baseline by 10.3/12.2 percentage points and, for the first time on this benchmark, even surpassing fully supervised methods. Code is available at: https://github.com/snt-arg/SUFLECA