HiSfM: Disambiguating Structure-from-Motion via Scaffold-Anchored Hierarchical Reconstruction
作者: Ziding Zhao, Hainan Cui, Peilin Tao, Shuhan Shen
分类: cs.CV
发布日期: 2026-09-04
🔗 代码/项目: GITHUB
💡 一句话要点
提出HiSfM以解决结构光重建中的视觉歧义问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 结构光重建 视觉歧义 层次化重建 机器人导航 三维建模 高效配准 图像处理
📋 核心要点
- 现有的SfM方法在处理重复或对称结构时容易出现视觉歧义,导致重建失败。
- HiSfM通过构建支架和层次化的重建流程,增强了对视觉歧义的鲁棒性和计算效率。
- 实验结果显示,HiSfM在歧义基准和一般数据集上显著提高了重建完整性,并减少了运行时间。
📝 摘要(中文)
结构光重建(SfM)是稀疏三维重建的重要工具,广泛应用于机器人和计算机视觉领域。然而,传统方法在面对重复或对称结构时常常出现视觉歧义,且由于冗余相机和约束导致计算成本高昂。本文提出了HiSfM,一个层次化的粗到细的SfM框架,通过支架构建提高了鲁棒性和效率。HiSfM首先利用几何启发式方法形成强大的局部社区,然后通过打包边不相交的生成树连接社区,并使用双视图去歧义器验证骨架边。我们在验证的骨架上重建稳定的支架,作为捕捉场景本质的锚点,随后通过高效的配准和三角测量吸收剩余图像以进行进一步优化。实验结果表明,HiSfM有效防止了因歧义引起的失败,并显著减少了运行时间,同时在完整性上优于激进稀疏化方法。
🔬 方法详解
问题定义:本文旨在解决传统SfM方法在面对视觉歧义时的重建失败问题,尤其是重复和对称结构带来的挑战。现有方法通常由于冗余相机和约束,导致计算成本高且效率低下。
核心思路:HiSfM的核心思路是通过构建一个稳定的支架来捕捉场景的本质,同时利用层次化的重建流程来提高鲁棒性和效率。通过几何启发式方法形成局部社区,并通过连接这些社区的骨架来实现更高效的重建。
技术框架:HiSfM的整体架构包括几个主要模块:首先是局部社区的形成,其次是通过边不相交的生成树连接社区,最后在验证的骨架上重建支架,并通过高效的配准和三角测量吸收剩余图像。
关键创新:HiSfM的关键创新在于其支架构建和层次化重建的结合,能够有效防止因视觉歧义引起的重建失败。这一方法与传统SfM方法在处理复杂场景时的策略有本质区别。
关键设计:在设计中,HiSfM采用了几何启发式方法来形成局部社区,并使用双视图去歧义器来验证骨架边。此外,采用了高效的图像配准和三角测量技术,以确保重建的准确性和效率。
🖼️ 关键图片
📊 实验亮点
实验结果表明,HiSfM在歧义基准测试中有效防止了重建失败,相比于传统方法,运行时间显著减少,同时在完整性方面超过了激进稀疏化方法,展示了其在实际应用中的优越性。
🎯 应用场景
HiSfM在机器人导航、三维地图构建和虚拟现实等领域具有广泛的应用潜力。其提高的鲁棒性和效率能够帮助这些领域更好地处理复杂场景,提升用户体验和系统性能。未来,HiSfM有望在大规模场景建模和实时应用中发挥更大作用。
📄 摘要(原文)
Structure-from-Motion (SfM) is a fundamental tool for sparse 3D reconstruction with broad impact in robotics and vision, supporting mapping, localization, and large-scale scene modeling. However, conventional pipelines often fail under hard visual ambiguity caused by repeated or symmetric structures, and incur heavy computational cost due to redundant cameras and constraints. We present HiSfM, a hierarchical coarse-to-fine SfM framework that improves robustness and efficiency through scaffold construction. HiSfM first forms strong local communities using geometrical induced heuristics, then connects communities with a compact yet strong skeleton by packing edge-disjoint spanning trees (EDST) while verifying skeletal edges with a two-view disambiguator. We reconstruct a stable scaffold on this verified skeleton, serving as an anchor to capture the essence of the scene, and subsequently absorb remaining images via efficient registration and triangulation for further refinements. Experiments on ambiguity-focused benchmarks and general datasets show that HiSfM prevents ambiguity-induced failures while substantially reducing runtime compared to previous methods, and improves completeness over aggressive sparsification methods. Code is available at https://github.com/3dv-casia/HiSfM.