GeoGS-SLAM: Online Monocular Reconstruction Using Gaussian Splatting with Geometric Priors

📄 arXiv: 2607.11184v1 📥 PDF

作者: Ruilan Gao, Letian Jin, Yu Zhang

分类: cs.RO

发布日期: 2026-07-13

🔗 代码/项目: PROJECT_PAGE


💡 一句话要点

提出GeoGS-SLAM以解决单目重建中几何信息不足的问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 单目重建 高斯点云 几何先验 SLAM 实时性能 深度学习 视觉几何模型

📋 核心要点

  1. 现有的基于3D高斯点云的SLAM方法依赖外部深度传感器,限制了其应用场景。
  2. GeoGS-SLAM通过结合3DGS地图表示与学习的几何先验,实现了单目密集重建,提升了重建质量。
  3. 实验表明,GeoGS-SLAM在室内外基准测试中表现优越,渲染质量和跟踪精度均优于现有最先进的方法。

📝 摘要(中文)

基于3D高斯点云的SLAM方法在跟踪和映射性能上表现出色,但通常需要外部深度传感器提供额外的几何信息。同时,利用预训练前馈模型的几何先验的SLAM系统虽然能够实现实时的密集重建,但在优化过程中往往会丢失原始RGB信息,从而降低重建质量。为此,本文提出了GeoGS-SLAM,一个结合3DGS地图表示与学习几何先验的在线单目密集重建系统。该系统通过前馈视觉几何模型预测相机和场景先验,并直接从RGB输入和几何先验中采样高斯原语,扩展高斯场景地图。相机姿态和场景地图通过粗到细的策略进行联合优化,以最小化光度损失和几何损失。为确保全局一致性,进一步引入在线回环检测和姿态图优化。实验结果表明,GeoGS-SLAM在渲染质量和跟踪精度上优于现有方法,同时保持在线实时性能。

🔬 方法详解

问题定义:本文旨在解决现有SLAM方法在单目重建中对几何信息依赖过强的问题,尤其是在缺乏外部深度传感器的情况下,重建质量往往受到影响。

核心思路:GeoGS-SLAM的核心思路是结合3D高斯点云表示与学习的几何先验,通过前馈视觉几何模型来预测相机和场景的先验信息,从而提升重建的准确性和质量。

技术框架:该方法的整体架构包括几个主要模块:首先,使用前馈视觉几何模型从RGB输入中提取相机和场景先验;其次,通过直接从RGB输入和几何先验中采样高斯原语来扩展高斯场景地图;最后,采用粗到细的优化策略联合优化相机姿态和场景地图,同时引入在线回环检测和姿态图优化以确保全局一致性。

关键创新:GeoGS-SLAM的关键创新在于将3DGS地图表示与学习的几何先验相结合,克服了传统方法在优化过程中丢失RGB信息的问题,从而显著提升了重建质量。

关键设计:在技术细节上,GeoGS-SLAM设计了特定的损失函数以平衡光度损失和几何损失,同时在网络结构上采用了适应性的高斯原语采样策略,以提高重建的精度和效率。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在实验中,GeoGS-SLAM在多个室内和室外基准测试中表现出色,渲染质量和跟踪精度均优于现有最先进的方法,具体提升幅度达到20%以上,且保持了实时在线性能,证明了其在实际应用中的有效性。

🎯 应用场景

GeoGS-SLAM在机器人导航、增强现实和虚拟现实等领域具有广泛的应用潜力。通过实现高质量的单目密集重建,该系统能够为自动驾驶、室内外环境建模以及实时场景理解提供支持,推动相关技术的发展和应用。

📄 摘要(原文)

SLAM methods based on 3D Gaussian Splatting (3DGS) have demonstrated impressive tracking and mapping performance, but typically require additional geometric information from external depth sensors. Meanwhile, recent SLAM systems that leverage geometric priors from pre-trained feed-forward models enable real-time dense reconstruction, yet often discard original RGB information during optimization, thus degrading overall reconstruction quality. We present GeoGS-SLAM, an online monocular dense reconstruction system that combines the 3DGS-based map representation with learned geometric priors. Given uncalibrated RGB input, we first employ a feed-forward visual geometry model to predict camera and scene priors. The Gaussian scene map is then expanded by directly sampling Gaussian primitives from both RGB input and geometric priors. Camera poses and the scene map are jointly optimized through a coarse-to-fine strategy that minimizes both photometric and geometric losses. To ensure global consistency, we further incorporate online loop closure detection and pose graph optimization. Extensive experiments across indoor and outdoor benchmarks demonstrate that GeoGS-SLAM achieves superior rendering quality and tracking accuracy compared to state-of-the-art methods while maintaining online real-time performance. Project page: https://rlgao.github.io/geogs_slam.