Implicit 4D Gaussian Splatting for Fast Motion with Large Inter-Frame Displacements

📄 arXiv: 2607.12362v1 📥 PDF

作者: Seung-gyeom Kim, Areum Kim, Yongjae Yoo, Sukmin Yun

分类: cs.CV

发布日期: 2026-07-14

备注: Accepted at ICLR 2026. Project page at https://seung-gyeom.github.io/SPIN-4DGS


💡 一句话要点

提出SPIN-4DGS以解决快速运动下的高质量重建问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics) 支柱八:物理动画 (Physics-based Animation)

关键词: 4D高斯点云 快速运动 时空一致性 重建质量 计算机视觉 深度学习 轻量级网络 运动捕捉

📋 核心要点

  1. 现有的4D高斯点云方法在快速运动和大帧间位移下表现不佳,导致重建质量下降。
  2. 本文提出SPIN-4DGS,通过显式收集时空位置学习高斯属性,避免了传统方法的不足。
  3. 实验表明,SPIN-4DGS在大位移情况下的重建精度显著提高,PSNR提升达1.83,优于现有最强基线D3DGS。

📝 摘要(中文)

近年来的4D高斯点云方法在快速运动和大帧间位移的情况下常常表现不佳,导致高斯属性在训练过程中学习不充分,快速移动的物体在重建中丢失。本文提出了一种时空位置隐式网络SPIN-4DGS,通过显式收集时空位置来学习高斯属性,而不是建模时间位移,从而在快速运动和大帧间位移下实现更真实的点云重建。为了避免在所有时空位置上显式优化属性带来的高内存开销,本文采用轻量级前馈网络进行预测,并在基于光栅化的重建损失下进行训练。实验结果表明,SPIN-4DGS在大位移情况下的重建精度显著提高,尤其在CMU Panoptic数据集的挑战性运动场景中,PSNR和SSIM均有明显改善。

🔬 方法详解

问题定义:本文旨在解决现有4D高斯点云方法在快速运动和大帧间位移下的重建质量下降问题。现有方法在训练过程中未能有效学习高斯属性,导致快速移动物体的重建丢失。

核心思路:SPIN-4DGS通过显式收集时空位置来学习高斯属性,而不是依赖于时间位移建模。这种方法能够更真实地捕捉快速运动下的物体特征,从而提高重建质量。

技术框架:SPIN-4DGS的整体架构包括一个轻量级前馈网络,该网络在光栅化重建损失下进行训练。通过这种方式,网络能够有效预测高斯属性,避免了在所有时空位置上显式优化带来的内存开销。

关键创新:SPIN-4DGS的主要创新在于其学习高斯属性的方式,通过显式时空位置而非时间位移建模,显著提升了快速运动场景下的重建效果。这一方法与现有方法的本质区别在于其对时空一致性的更好捕捉。

关键设计:在网络设计上,SPIN-4DGS采用了轻量级前馈网络结构,并使用基于光栅化的损失函数进行训练。这种设计使得模型在保持高效性的同时,能够学习到共享的高斯表示,增强了时空一致性。具体的参数设置和网络结构细节在论文中有详细描述。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在实验中,SPIN-4DGS在CMU Panoptic数据集的挑战性运动场景中表现出色,PSNR提升达1.83,明显优于最强基线D3DGS,显示了其在大位移情况下的高重建精度和稳定性。

🎯 应用场景

该研究的潜在应用领域包括计算机视觉、动画制作、虚拟现实和增强现实等。通过提高快速运动场景下的重建质量,SPIN-4DGS能够为实时渲染和交互式应用提供更高的视觉效果,具有重要的实际价值和未来影响。

📄 摘要(原文)

Recent 4D Gaussian Splatting (4DGS) methods often fail under fast motion with large inter-frame displacements, where Gaussian attributes are poorly learned during training, and fast-moving objects are often lost from the reconstruction. In this work, we introduce Spatiotemporal Position Implicit Network for 4DGS, coined SPIN-4DGS, which learns Gaussian attributes from explicitly collected spatiotemporal positions rather than modeling temporal displacements, thereby enabling more faithful splatting under fast motions with large inter-frame displacements. To avoid the heavy memory overhead of explicitly optimizing attributes across all spatiotemporal positions, we instead predict them with a lightweight feed-forward network trained under a rasterization-based reconstruction loss. Consequently, SPIN-4DGS learns shared representations across Gaussians, effectively capturing spatiotemporal consistency and enabling stable high-quality Gaussian splatting even under challenging motions. Across extensive experiments, SPIN-4DGS consistently achieves higher fidelity under large displacements, with clear improvements in PSNR and SSIM on challenging sports scenes from the CMU Panoptic dataset. For example, SPIN-4DGS notably outperforms the strongest baseline, D3DGS, by achieving +1.83 higher PSNR on the Basketball scene.