ReCal3R: Reliability-Calibrated Learning Rates for Streaming 3D Reconstruction

📄 arXiv: 2607.05356 📥 PDF

作者: Xinze Li, Yiyuan Wang, Pengxu Chen, Weifeng Su, Weisi Lin, Wentao Cheng

分类: cs.CV

发布日期: 2026-07-20


💡 一句话要点

提出ReCal3R以解决流式3D重建中的可靠性问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 流式3D重建 学习率校准 状态可靠性 动态更新 计算机视觉

📋 核心要点

  1. 流式3D重建中的重复更新会导致场景状态的可靠性下降,影响重建质量。
  2. ReCal3R通过估计状态令牌的可靠性来校准学习率,从而优化更新策略。
  3. 在长序列上,ReCal3R显著提升了重建精度,ATE减少3.7倍,性能优越。

📝 摘要(中文)

流式3D重建依赖于紧凑的递归场景状态来处理长图像流,但重复更新可能导致状态逐渐损坏,可靠的历史信息被噪声或模糊观测覆盖。本文提出ReCal3R,一种用于递归3D重建的可靠性校准学习率方法。该方法通过估计状态令牌的可靠性来校准候选学习率,从而抑制对不可靠令牌的激进更新,同时保持对信息帧的适应性。应用于CUT3R作为无训练的校准规则,ReCal3R在长序列的姿态、深度和重建质量上表现出色,ATE减少了3.7倍,同时保持了相似的运行时间和内存使用。

🔬 方法详解

问题定义:本文旨在解决流式3D重建中由于重复更新导致的场景状态可靠性下降的问题。现有方法在处理长图像流时,容易受到噪声和模糊观测的影响,导致重建质量下降。

核心思路:ReCal3R的核心思想是通过估计状态令牌的可靠性来校准学习率,而不是直接应用候选学习率。这种设计能够抑制对不可靠令牌的激进更新,同时保持对有用信息的适应性。

技术框架:该方法的整体架构包括三个主要模块:状态令牌的可靠性估计、候选学习率的计算,以及基于可靠性进行的学习率校准。通过这些模块,ReCal3R能够动态调整学习率以适应不同的场景状态。

关键创新:ReCal3R的主要创新在于引入了可靠性校准机制,使得学习率能够根据状态令牌的可靠性进行动态调整。这与现有方法的静态学习率策略形成了鲜明对比,显著提升了重建的稳定性和准确性。

关键设计:在参数设置上,ReCal3R结合了令牌对齐、状态重建残差和最近更新压力来计算候选学习率。此外,采用了保守的基础学习率与候选学习率之间的插值策略,以确保在不可靠情况下的更新被抑制。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在实验中,ReCal3R在长序列的姿态、深度和重建质量上表现出色,尤其是在ATE方面实现了3.7倍的减少,且在运行时间和内存使用上与基线方法相当,显示出其高效性和实用性。

🎯 应用场景

ReCal3R在流式3D重建领域具有广泛的应用潜力,尤其是在自动驾驶、虚拟现实和增强现实等需要实时处理大规模数据的场景中。通过提高重建的可靠性和精度,该方法能够为相关应用提供更为稳定和高效的支持,推动技术的进一步发展。

📄 摘要(原文)

Streaming 3D reconstruction relies on a compact recurrent scene state to process long image streams in linear time and bounded memory. However, repeated updates can gradually corrupt this state, causing reliable historical information to be overwritten by noisy or ambiguous observations. We introduce ReCal3R, a reliability-calibrated learning rate method for recurrent 3D reconstruction. Instead of directly applying a candidate learning rate, our method estimates state token reliability from the maintained scene state and uses it to calibrate a candidate learning rate derived from token alignment, state reconstruction residual, and recent update pressure. The resulting token-wise learning rate interpolates between a conservative base rate and the candidate rate, suppressing aggressive updates on unreliable tokens while preserving adaptation to informative frames. Applied to CUT3R as a training-free calibration rule, ReCal3R reaches strong performance on long sequences in pose, depth, and reconstruction quality, including a 3.7$\times$ reduction in ATE, with comparable runtime and memory. Code is available at:this https URL.