DGSfM: Depth-Guided Scale-Aware Global Structure-from-Motion
作者: Sithu Aung, Viktor Kocur, Yaqing Ding, Torsten Sattler, Zuzana Kukelova
分类: cs.CV
发布日期: 2026-07-10
🔗 代码/项目: GITHUB
💡 一句话要点
提出DGSfM以解决全局结构光束法中的尺度模糊问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 全局结构光束法 深度感知 相机姿态 三维重建 计算机视觉 鲁棒性 深度图 视觉匹配
📋 核心要点
- 现有全局SfM方法依赖于尺度模糊的极线几何,导致全局定位对噪声和弱约束敏感,重建质量下降。
- DGSfM通过引入单目深度图作为先验,利用深度感知的相对姿态求解器将尺度模糊约束转化为尺度感知约束,增强了鲁棒性。
- 在ETH3D和IMC2021上的实验表明,DGSfM在姿态精度上显著优于现有的全局SfM基线,提升幅度明显。
📝 摘要(中文)
全局结构光束法(SfM)是一种高效的从无序图像中恢复相机姿态和稀疏三维结构的方法。然而,其对尺度模糊的依赖使得全局定位对噪声基线估计和弱视图图约束敏感,同时来自视觉模糊对的错误边缘会进一步降低重建质量。我们提出了DGSfM,一个深度感知的全局SfM管道,利用单目深度图作为可扩展的先验,同时保持显式的多视图优化。对于每对图像,我们使用深度感知的相对姿态求解器将尺度模糊的极线约束转换为尺度感知的相对姿态约束。通过视图图过滤和基于深度一致性的对应修剪,我们进一步提高了鲁棒性,抑制了在极线几何下仍然合理的错误边缘和匹配。最后,全球尺度平均和深度引导的姿态-点初始化将单目深度图对齐到一个共同的重建尺度,并为全局定位和束调整提供稳定的初始化。实验结果表明,DGSfM在稀疏和密集匹配前端上均优于强大的全局SfM基线,显著提高了姿态精度。
🔬 方法详解
问题定义:论文旨在解决全局结构光束法中由于尺度模糊导致的相机姿态和三维结构重建不准确的问题。现有方法在噪声和弱视图图约束下表现不佳,容易受到错误匹配的影响。
核心思路:DGSfM的核心思路是利用单目深度图作为可扩展的先验信息,通过深度感知的相对姿态求解器将尺度模糊的极线约束转化为尺度感知的约束,从而提高重建的鲁棒性和准确性。
技术框架:DGSfM的整体架构包括多个模块:首先,使用深度感知的相对姿态求解器处理图像对,接着进行视图图过滤和深度一致性修剪,最后通过全球尺度平均和深度引导的初始化实现全局定位和束调整。
关键创新:DGSfM的主要创新在于引入深度感知的相对姿态求解器和深度一致性修剪技术,这与传统方法的尺度模糊处理方式有本质区别,显著提升了重建的准确性和鲁棒性。
关键设计:在设计中,深度感知的相对姿态求解器通过优化算法实现尺度感知约束,视图图过滤和深度一致性修剪则通过设置合理的阈值和匹配标准来抑制错误匹配,确保重建质量。整体流程中,参数设置和损失函数的选择对最终结果有重要影响。
🖼️ 关键图片
📊 实验亮点
在ETH3D和IMC2021的实验中,DGSfM在稀疏和密集匹配前端上均表现出显著的性能提升,相较于强大的全局SfM基线,姿态精度提高了多个百分点,验证了其有效性和鲁棒性。
🎯 应用场景
DGSfM的研究成果在计算机视觉、机器人导航、增强现实等领域具有广泛的应用潜力。通过提高三维重建的准确性,该方法能够为自动驾驶、无人机导航及虚拟现实等技术提供更为可靠的基础,推动相关领域的发展。
📄 摘要(原文)
Global Structure-from-Motion (SfM) is an efficient paradigm for recovering camera poses and sparse 3D structure from unordered images. However, its reliance on scale-ambiguous epipolar geometry makes global positioning sensitive to noisy baseline estimates and weak view-graph constraints, while false edges from visually ambiguous pairs can further degrade reconstruction. We propose DGSfM, a depth-aware global SfM pipeline that uses monocular depth maps as a scalable prior while preserving explicit multi-view optimization. For each image pair, we use a depth-aware relative pose solver to convert scale-ambiguous epipolar constraints into scale-aware relative pose constraints. We further improve robustness through view-graph filtering and depth-consistency-based correspondence pruning, which suppress false edges and matches that remain plausible under epipolar geometry alone. Finally, global scale averaging and depth-guided pose-point initialization align monocular depth maps into a common reconstruction scale and provide stable initialization for global positioning and bundle adjustment. Experiments on ETH3D and IMC2021 show that DGSfM consistently improves over strong global SfM baselines across sparse and dense matching front-ends, achieving substantial gains in pose accuracy. Code is available at https://github.com/sithu31296/DGSfM.