PIXIE: A Zero-Shot texture-invariant 6D pose estimation framework for unseen objects with assembly defects
作者: Leon Jungemeyer, Alejandro Magaña, Gautham Mohan, Matthias Karl, Daniel Werdehausen
分类: cs.CV, cs.RO
发布日期: 2026-07-20
💡 一句话要点
提出PIXIE框架以解决无纹理物体的6D姿态估计问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 6D姿态估计 无纹理物体 几何鲁棒性 跨模态特征匹配 工业机器人 自动化装配 深度学习
📋 核心要点
- 现有的6D姿态估计方法在处理无纹理物体和组装缺陷时面临显著挑战,尤其是在工业应用中。
- PIXIE框架通过仅使用无纹理3D模型和RGB图像,采用几何特征进行6D姿态估计,避免了对纹理的依赖。
- 在公共基准测试中,PIXIE在无纹理物体上取得了最新的结果,并展示了其在处理组装缺陷和遮挡方面的实际应用潜力。
📝 摘要(中文)
6D姿态估计在机器人和计算机视觉领域仍然是一个关键挑战,尤其是在工业环境中。现有的数据驱动方法通常受限于资源密集型的数据管道、对纹理3D模型的依赖,以及对损坏或组装缺陷引起的几何偏差的敏感性。本文提出了PIXIE,一个零样本框架,利用RGB图像和无纹理3D模型来估计物体的6D姿态。通过从采样的参考视点渲染合成深度和法线图,并通过预训练的跨模态特征匹配器与查询图像进行匹配,获得2D-3D对应关系以进行PnP姿态估计。该方法仅依赖几何特征,使其对光照和纹理变化具有固有的鲁棒性,同时通过对应关系过滤处理模型与物理对象之间的几何偏差。我们在广泛使用的公共基准上进行了评估,报告了在无纹理物体上的最新结果,并引入了一个包含组装缺陷、纹理变化和遮挡的新数据集,以展示其在实际应用中的可行性。
🔬 方法详解
问题定义:本文旨在解决在工业环境中进行6D姿态估计时,现有方法对纹理和几何偏差的敏感性问题。现有的数据驱动方法通常需要大量的标注数据和复杂的纹理模型,限制了其在实际应用中的有效性。
核心思路:PIXIE框架的核心思想是利用无纹理3D模型和RGB图像进行姿态估计,完全依赖几何信息,从而提高对光照和纹理变化的鲁棒性。通过合成深度和法线图,结合预训练的特征匹配器,建立2D-3D对应关系以进行姿态估计。
技术框架:PIXIE的整体架构包括三个主要模块:首先,从多个参考视点渲染合成深度和法线图;其次,使用预训练的跨模态特征匹配器与查询图像进行匹配;最后,通过PnP算法进行姿态估计,利用匹配的关键点进行2D-3D对应关系的建立。
关键创新:PIXIE的主要创新在于其零样本学习能力,能够在没有特定物体训练的情况下,直接对无纹理物体进行6D姿态估计。这一方法显著减少了对纹理信息的依赖,使得在实际应用中更具灵活性和适应性。
关键设计:在技术细节上,PIXIE采用了合成深度和法线图的生成策略,确保了几何信息的准确性。同时,特征匹配器的预训练过程优化了匹配精度,增强了系统对几何偏差的容忍度。
🖼️ 关键图片
📊 实验亮点
在实验中,PIXIE在无纹理物体的6D姿态估计上达到了最新的性能,超越了现有的基线方法,特别是在处理组装缺陷和遮挡方面表现出色。具体来说,PIXIE在多个公共基准测试中实现了显著的性能提升,展示了其在实际应用中的有效性。
🎯 应用场景
该研究的潜在应用领域包括工业机器人、自动化装配、物体识别和增强现实等。PIXIE框架能够在缺乏纹理信息的情况下,准确估计物体姿态,极大地提高了机器人在复杂环境中的操作能力,具有广泛的实际价值和未来影响。
📄 摘要(原文)
6D pose estimation remains a key challenge in robotics and computer vision, particularly in industrial environments. The deployment of currently available data-driven methods is often limited by resource-intensive data pipelines, reliance on textured 3D models, and sensitivity to geometric deviations caused by damages or assembly defects. We present PIXIE, a zero-shot framework that estimates the 6D pose of an object from an RGB image using only an untextured 3D model. Synthetic depth and normal maps are rendered from sampled reference viewpoints and matched to the query image via a pretrained cross-modality feature matcher. Matched keypoints are back-projected to obtain 2D--3D correspondences for PnP-based pose estimation. Relying exclusively on geometry makes the method inherently robust to lighting and texture variation, while correspondence filtering handles geometric deviations between the model and physical object. We evaluate on widely-used public benchmarks, reporting state-of-the-art results on texture-less objects without object-specific training, and introduce a novel dataset with assembly defects, texture variations, and occlusion to demonstrate real-world applicability.