FF-ProCams: Feed-Forward Gaussian Splatting for Projector-Camera System
作者: Ziyao Wang, Yuqi Li, Wenxing Zheng, Jiaying Chen, Chong Wang
分类: cs.CV
发布日期: 2026-07-20
🔗 代码/项目: GITHUB
💡 一句话要点
提出FF-ProCams以解决投影仪-相机系统的高效逆渲染问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture) 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 投影仪-相机系统 高斯逆渲染 前馈学习 空间增强现实 实时渲染 可微渲染器 多视图聚合
📋 核心要点
- 现有的ProCams逆渲染方法依赖耗时的逐场景优化,难以满足实时性需求。
- FF-ProCams通过前馈3D高斯逆渲染框架,结合Mamba2-Transformer编码器和可微渲染器,提升了渲染效率与灵活性。
- 实验结果显示,FF-ProCams在仅使用8个输入视图的情况下,显著超越了297视图的优化基线,重建速度提升至0.13秒。
📝 摘要(中文)
投影仪-相机(ProCams)系统通过结构化照明实现主动场景感知和可控外观操控,是空间增强现实、投影映射和表面反射获取的核心基础设施。现有的ProCams逆渲染方法虽然能够提供高保真结果,但依赖耗时的逐场景优化,而主流的前馈3D重建模型则产生无法适应空间变化的投影仪照明的固定外观。为了解决这一准确性与效率的权衡,本文提出了FF-ProCams,一个用于ProCams的前馈3D高斯逆渲染框架。该框架通过混合Mamba2-Transformer编码器聚合稀疏多视图观察的几何和光度线索,并通过轻量头在单次前向传递中预测可重光照的高斯表示。我们进一步设计了一个投影仪感知的可微渲染器,以在任意主动照明和ProCams姿态下合成相机观察。实验表明,FF-ProCams实现了高保真的投影仪感知渲染,能够推广到未见模式,并支持新颖的投影仪-相机姿态。仅使用8个输入视图,其性能超过297视图的优化基线,同时将测试时间重建缩短至0.13秒(速度提升三到五个数量级)。
🔬 方法详解
问题定义:本文旨在解决投影仪-相机系统中的高效逆渲染问题。现有方法通常需要耗时的逐场景优化,导致实时性不足,且主流的3D重建模型无法适应空间变化的投影仪照明。
核心思路:FF-ProCams提出了一种前馈3D高斯逆渲染框架,通过聚合多视图的几何和光度信息,快速生成可重光照的高斯表示,从而提高渲染效率和适应性。
技术框架:该框架包括一个混合Mamba2-Transformer编码器,用于处理稀疏多视图数据,和一个投影仪感知的可微渲染器,能够在任意照明条件下合成相机观察。
关键创新:FF-ProCams的主要创新在于其前馈处理能力和高效的高斯表示生成,与传统的逐场景优化方法相比,显著提高了渲染速度和灵活性。
关键设计:该方法采用轻量级的网络结构,设计了适应不同投影仪照明条件的损失函数,确保在多种场景下的高保真渲染。
🖼️ 关键图片
📊 实验亮点
FF-ProCams在仅使用8个输入视图的情况下,成功实现了高保真的投影仪感知渲染,显著超越了传统优化基线(297视图),并将测试时间重建缩短至0.13秒,提升幅度达到三到五个数量级。
🎯 应用场景
FF-ProCams的研究成果在空间增强现实、投影映射和表面反射获取等领域具有广泛的应用潜力。其高效的渲染能力和灵活的适应性使其能够在实时交互和动态场景中发挥重要作用,推动相关技术的发展与应用。
📄 摘要(原文)
Projector-camera (ProCams) systems achieve active scene perception and controllable appearance manipulation via structured illumination, serving as a core infrastructure for spatial augmented reality, projection mapping, and surface reflectance acquisition. Existing inverse-rendering methods for ProCams deliver high-fidelity results but rely on time-consuming per-scene optimization, while mainstream feed-forward 3D reconstruction models produce baked appearance that cannot adapt to spatially varying projector illumination. To resolve this accuracy-efficiency trade-off, we propose FF-ProCams, a Feed-Forward 3D Gaussian inverse-rendering framework for ProCams. A hybrid Mamba2-Transformer encoder aggregates cross-view geometric and photometric cues from sparse multi-view observations, and lightweight heads predict a relightable Gaussian representation in a single forward pass. We further design a projector-aware differentiable renderer to synthesize camera observations under arbitrary active illumination and ProCams poses. To enable feed-forward training, we construct a large-scale synthetic ProCams dataset covering diverse object geometries and surface materials. Experiments show FF-ProCams achieves high-fidelity projector-aware rendering, generalizes to unseen patterns, and supports novel projector-camera poses. Using only 8 input views, it outperforms optimization-based baselines with 297 views while reducing test-time reconstruction to 0.13 seconds (a three-to-five-order-of-magnitude speedup). The code and data are available at https://github.com/CPREgroup/FF-ProCams/.