AnythingReality: Robust Online Gaussian Splatting SLAM for Open-Vocabulary VR Scene Exploration

📄 arXiv: 2607.09260v1 📥 PDF

作者: Timofei Kozlov, Dmitrii Maliukov, Andrey Marchenko, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

分类: cs.CV

发布日期: 2026-07-10


💡 一句话要点

提出在线高斯点云SLAM以解决VR场景探索中的噪声问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 高斯点云 SLAM 虚拟现实 语音交互 图像质量 鲁棒性 实时处理 视觉-语言模型

📋 核心要点

  1. 现有方法通常假设输入数据干净,无法有效处理真实世界中的噪声和不确定性。
  2. 本研究提出了一种结合ORB-SLAM3姿态估计与在线高斯重建的系统,能够实时处理噪声数据并进行虚拟现实探索。
  3. 实验结果显示,本文方法在图像质量和物体识别率上均显著优于现有在线高斯点云方法,提升幅度明显。

📝 摘要(中文)

本文提出了一种新颖的集成架构,用于鲁棒的在线3D高斯点云重建、实时虚拟现实探索以及语音驱动的视觉-语言模型交互。与假设干净深度或外部姿态的方法不同,我们的系统结合了基于ORB-SLAM3的姿态估计和在线高斯重建,以处理噪声的真实世界数据。VR管道使得增量重建的沉浸式探索成为可能,语义模块则转录语音指令,生成场景描述并记录兴趣点。与最先进的在线高斯点云方法相比,我们在数据集上提高了图像质量(PSNR提升14.5%,SSIM提升8.6%,LPIPS降低14.3%),在TUM-RGBD上也有类似的提升(PSNR提升11.7%,SSIM提升7.8%,LPIPS降低21.6%),并在质量-速度配置下实现了可比或更优的帧率。我们达到了88%的视觉-语言模型物体识别率。

🔬 方法详解

问题定义:本文旨在解决在虚拟现实场景探索中,现有在线高斯点云重建方法对噪声数据处理不佳的问题。现有方法通常假设输入数据干净,无法有效应对真实世界中的噪声和不确定性。

核心思路:本研究提出了一种新颖的集成架构,结合ORB-SLAM3的姿态估计与在线高斯重建,能够在处理噪声数据的同时实现实时的虚拟现实探索。该设计旨在提高系统的鲁棒性和用户体验。

技术框架:整体架构包括三个主要模块:1) 基于ORB-SLAM3的姿态估计模块,负责实时获取相机位姿;2) 在线高斯重建模块,处理噪声数据并生成3D重建;3) 语义模块,负责语音指令的转录、场景描述生成及兴趣点记录。

关键创新:本研究的关键创新在于将姿态估计与在线高斯重建相结合,形成一个完整的VR探索系统,显著提升了对噪声数据的处理能力,与传统方法相比具有更高的鲁棒性和准确性。

关键设计:在技术细节上,采用了优化的损失函数以平衡重建质量与计算效率,并在网络结构上进行了针对性的调整,以适应实时处理的需求。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果表明,本文方法在图像质量上显著优于现有在线高斯点云方法,具体表现为在自有数据集上PSNR提升14.5%,SSIM提升8.6%,LPIPS降低14.3%;在TUM-RGBD数据集上PSNR提升11.7%,SSIM提升7.8%,LPIPS降低21.6%。此外,系统在质量-速度配置下实现了可比或更优的帧率,物体识别率达到88%。

🎯 应用场景

该研究的潜在应用场景包括虚拟现实游戏、建筑可视化、教育培训等领域。通过提供鲁棒的场景重建和交互能力,能够显著提升用户的沉浸体验和交互效率,具有广泛的实际价值和未来影响。

📄 摘要(原文)

We present a novel integrated architecture for robust online 3D Gaussian splatting, real-time VR exploration, and speech-driven Vision-Language-Model interaction. Unlike methods assuming clean depth or external poses, our system combines ORB-SLAM3-based pose estimation with online Gaussian reconstruction for noisy real-world data. A VR pipeline enables immersive exploration of incremental reconstructions; a semantic module transcribes voice commands, generates scene descriptions, and records points of interest. Against state-of-the-art online Gaussian splatting methods, we improve image quality on our dataset (+14.5% PSNR, +8.6% SSIM, -14.3% LPIPS) and TUM-RGBD (+11.7% PSNR, +7.8% SSIM, -21.6% LPIPS), with comparable or superior frame rates via quality-speed configurations. We achieve an 88% VLM object-recognition rate.