WAT3R: Feedforward Underwater 3D Reconstruction

📄 arXiv: 2607.21023v1 📥 PDF

作者: Jiayi Xu, Jiahao Lu, Ziqiang Zheng, Yihao Tan, Yaolong Zhu, Yuan Liu, Sai-Kit Yeung

分类: cs.CV

发布日期: 2026-07-23


💡 一句话要点

提出WAT3R以解决水下3D重建中的光衰减与反向散射问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 水下3D重建 光衰减 反向散射 神经适应 多视图几何 深度估计 相机位姿估计

📋 核心要点

  1. 现有水下3D重建方法在光衰减和反向散射影响下,导致视觉质量下降和特征一致性破坏,难以实现准确的多视图几何重建。
  2. WAT3R框架通过轻量级神经适应模块,灵活应对水下成像退化,直接从水下视频中输出像素对齐的3D点图和相机位姿。
  3. 在FLSea、SQUID和USOD10K数据集上的实验结果显示,WAT3R在多视图/单目深度估计和相机位姿估计任务中均优于现有方法。

📝 摘要(中文)

可靠的前馈水下3D重建面临严重的光衰减和反向散射挑战,这些因素降低了视觉质量并破坏了视图间的特征一致性,导致多视图几何不准确。为了解决这一问题,本文提出了WAT3R,一个直接从水下图像重建3D场景的前馈框架。通过将退化适应作为几何约束过程,WAT3R集成了轻量级神经适应模块,以灵活应对水下成像效应,从而提高多视图重建质量。实验结果表明,该方法在FLSea、SQUID和USOD10K数据集上,始终优于现有的最先进方法。

🔬 方法详解

问题定义:本文旨在解决水下3D重建中由于光衰减和反向散射导致的视觉质量下降和特征一致性破坏的问题。现有方法在处理这些挑战时效果不佳,无法实现准确的多视图几何重建。

核心思路:WAT3R框架的核心思路是通过轻量级神经适应模块,灵活适应水下成像的退化效应,从而提高多视图重建的质量。该设计允许在单次前向传递中高效输出3D点图和相机位姿。

技术框架:WAT3R的整体架构包括数据输入、神经适应模块和3D重建模块。数据输入部分负责接收水下图像,神经适应模块用于处理成像退化,而3D重建模块则负责生成最终的3D点图和相机位姿。

关键创新:WAT3R的主要创新在于其轻量级神经适应模块的引入,使得框架能够有效应对水下成像的复杂性,与现有方法相比,显著提高了重建的准确性和效率。

关键设计:在技术细节上,WAT3R采用了特定的损失函数来优化重建质量,并设计了适合水下环境的网络结构,以确保在处理不同水下场景时的鲁棒性。该框架在单次前向传递中实现了高效的3D重建。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在FLSea、SQUID和USOD10K数据集上的实验表明,WAT3R在3D重建任务中表现优异,尤其在多视图和单目深度估计及相机位姿估计方面,均超过了当前最先进的方法,提升幅度显著。

🎯 应用场景

该研究的潜在应用领域包括水下考古、海洋生物研究和水下工程等。通过提供高质量的水下3D重建,WAT3R能够帮助科学家和工程师更好地理解和探索水下环境,推动相关领域的研究和应用发展。

📄 摘要(原文)

Reliable feedforward underwater 3D reconstruction remains challenging due to severe light attenuation and backscattering, which degrade visual quality and disrupt feature consistency across views, leading to inaccurate multi-view geometry. To address this issue, we propose WAT3R, a feed-forward framework for reconstructing 3D scenes directly from underwater images. By leveraging degradation adaptation as a geometry-constrained process, WAT3R integrates a lightweight neural adaptation module to flexibly account for these underwater imaging effects, thereby improving multi-view reconstruction quality. Implemented in a single forward pass, WAT3R directly and efficiently outputs pixel-aligned 3D point maps and camera poses from underwater videos, allowing a high-quality underwater 3D reconstruction. Experiments conducted on the FLSea, SQUID, and USOD10K datasets show that our method consistently outperforms state-of-the-art approaches on 3D reconstruction tasks, including multi-view/monocular depth estimation and camera pose estimation.