DreamSat-Pose: Spacecraft Pose Estimation from Single-View 3D Reconstructions and Learned 2D-3D Feature Matching

📄 arXiv: 2607.13449v1 📥 PDF

作者: Josiane Uwumukiza, Jocelyn Zhao, Giovanni Lavezzi, Giacomo Battaglia, Paolo Panicucci, Minduli C. Wijayatunga, Victor Rodriguez-Fernandez, Richard Linares

分类: cs.CV, cs.LG

发布日期: 2026-07-15


💡 一句话要点

提出DreamSat-Pose以解决未知航天器姿态估计问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics) 支柱六:视频提取与匹配 (Video Extraction)

关键词: 航天器姿态估计 三维重建 深度学习 图卷积网络 变换器匹配 自注意力机制 空间任务 计算机视觉

📋 核心要点

  1. 核心问题:现有方法在未知目标的航天器姿态估计中面临挑战,尤其是需要同时重建目标形状模型。
  2. 方法要点:提出的框架通过单张图像重建3D形状模型,并学习2D-3D对应关系来估计姿态。
  3. 实验或效果:在SPE3R数据集上,方法实现了0.157度的平均指向误差,展示了良好的泛化能力。

📝 摘要(中文)

六自由度姿态估计是自主对接和近距离操作中的关键任务。当目标未知时,这一任务变得尤为复杂,因为需要与目标形状模型的重建相结合。本文提出了一种新颖的框架,用于未知航天器对象的单次形状和姿态估计。通过单张图像,我们首先重建目标的3D形状模型,然后通过学习密集的2D-3D对应关系来估计相对的六自由度姿态。图像特征通过冻结的DINOv3视觉变换器提取,而几何特征则通过可训练的动态图卷积神经网络编码器从重建的点云中计算。双流变换器匹配器通过交替自注意力和交叉注意力来优化描述符,生成软对应关系,最终传递给透视-n-点求解器以恢复姿态。我们在SPE3R数据集上评估了该方法,并将FoundationPose作为当前最先进能力的代表基线。结果显示,仅使用单张图像和重建几何体即可实现0.157度的平均指向误差,展示了对未见航天器的强泛化能力。

🔬 方法详解

问题定义:本文旨在解决未知航天器的六自由度姿态估计问题。现有方法通常依赖于已知目标模型,难以处理未知对象的形状和姿态估计。

核心思路:提出的框架通过单张图像重建目标的3D形状模型,并利用学习的2D-3D对应关系来估计姿态。这种设计使得系统能够在缺乏先验知识的情况下进行有效的姿态估计。

技术框架:整体架构包括三个主要模块:首先使用DINOv3视觉变换器提取图像特征;其次,通过动态图卷积神经网络从重建的点云中计算几何特征;最后,利用双流变换器匹配器优化特征描述符,并通过透视-n-点求解器恢复姿态。

关键创新:最重要的技术创新在于结合了图像特征和几何特征的学习,通过双流变换器匹配器实现了自注意力和交叉注意力的交替优化,显著提升了姿态估计的准确性。

关键设计:在网络结构上,采用冻结的DINOv3作为特征提取器,动态图卷积神经网络作为几何特征计算模块,双流变换器匹配器则负责特征的匹配与优化。损失函数设计上,重点考虑了姿态估计的精度与鲁棒性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,提出的方法在SPE3R数据集上实现了0.157度的平均指向误差,相较于当前最先进的FoundationPose基线,展示了显著的性能提升,证明了其在未知航天器姿态估计中的有效性。

🎯 应用场景

该研究的潜在应用领域包括航天器自主对接、空间任务中的目标识别和跟踪等。通过提高未知航天器的姿态估计精度,能够显著提升航天任务的安全性和效率,具有重要的实际价值和未来影响。

📄 摘要(原文)

6-DoF pose estimation is a critical task in autonomous rendezvous and proximity operations. In the case of an unknown target, this task becomes challenging as it shall be paired with the reconstruction of the target shape model. In this article, we propose a novel framework for single-shot shape and pose estimation of unknown spacecraft objects. Given a single image, we first reconstruct a 3D shape model of the target, then estimate the relative six-degrees-of-freedom pose by learning dense 2D-3D correspondences. The image features are extracted using a frozen DINOv3 vision transformer, while the geometric features are computed from the reconstructed point cloud using a trainable dynamic graph convolutional neural network encoder. A dual-stream transformer matcher refines descriptors through alternating self- and cross-attention, producing soft correspondences that are passed to a Perspective-$n$-Point solver for pose recovery. We evaluate the method on the SPE3R dataset and consider FoundationPose as a representative baseline for current state-of-the-art capabilities. Results show reliable pose estimates achieving 0.157 degrees mean pointing error using only a single image and reconstructed geometry, demonstrating strong generalization to unseen spacecraft.