4D Human-Scene Reconstruction from Low-Overlap Captures
作者: Minhyuk Hwang, Sangmin Kim, Seunguk Do, Daneul Kim, Jaesik Park
分类: cs.CV
发布日期: 2026-07-10
备注: Accepted to SIGGRAPH Conference Papers '26. First two authors contributed equally. Project page: https://sisyphm.github.io/studiorecon-page/
💡 一句话要点
提出StudioRecon以解决低重叠相机下的人体场景重建问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 4D重建 低重叠相机 视频扩散模型 动态场景重建 人类替换 背景增强 跨视角关联
📋 核心要点
- 现有的4D重建方法在低重叠相机设置下仍然会产生伪影,影响输出质量。
- 本文提出StudioRecon,通过解耦背景与人类,利用视频扩散模型增强背景监督。
- 在四个真实世界数据集上,StudioRecon实现了最先进的新视角合成,展示了良好的应用潜力。
📝 摘要(中文)
现有的动态人体性能体积捕捉依赖于密集的相机阵列,然而在实际场景中,往往只有少量低重叠的相机可用,这导致输出质量下降并且存在大量未观察区域。尽管近期的4D重建方法已针对低重叠设置进行研究,但在观察不足的区域仍然会产生明显的伪影。为了解决这些问题,本文提出了StudioRecon,一个从稀疏低重叠相机重建4D人类场景的管道,通过解耦背景和人类来实现。我们通过视频扩散模型合成数百个相机控制的新视角来增强背景监督,并通过跨视角身份关联和三角测量多视角关键点拟合来稳健初始化可变形高斯人类。最后,我们的递归增强模块通过运动自适应一致性注入来协调合成输出,进一步避免剩余伪影。我们在四个真实世界数据集上实现了最先进的新视角合成,并展示了新轨迹渲染和人类替换等应用。
🔬 方法详解
问题定义:本文旨在解决在低重叠相机条件下进行4D人类场景重建时,输出质量下降和伪影产生的问题。现有方法在观察不足的区域表现不佳,导致重建结果不理想。
核心思路:StudioRecon的核心思路是通过解耦背景与人类,利用视频扩散模型合成新视角,从而增强背景的监督信息,改善重建质量。
技术框架:该方法包括多个主要模块:首先,通过视频扩散模型生成数百个新视角以增强背景信息;其次,使用跨视角身份关联和三角测量技术初始化可变形高斯人类;最后,递归增强模块通过运动自适应一致性注入来协调输出。
关键创新:最重要的创新在于通过解耦背景与人类的方式,结合视频扩散模型进行背景增强,这与现有方法的整体处理方式有本质区别。
关键设计:在设计中,采用了跨视角身份关联来确保人类模型的一致性,并通过三角测量技术进行关键点拟合,确保了模型的稳定性和准确性。
🖼️ 关键图片
📊 实验亮点
在实验中,StudioRecon在四个真实世界数据集上实现了最先进的新视角合成,显著减少了伪影的产生,提升了重建质量,具体性能数据未提供,但相较于基线方法有明显的提升。
🎯 应用场景
该研究的潜在应用领域包括虚拟现实、游戏开发和影视制作等,能够为动态场景的重建和人类替换提供高质量的解决方案。未来,随着技术的进一步发展,StudioRecon有望在更多实际应用中发挥重要作用。
📄 摘要(原文)
Existing volumetric capture of dynamic human performance achieves high fidelity with dense camera arrays. However, in real-world scenarios, only a handful of low-overlap cameras are available, which degrades the output quality and leaves large areas unobserved. Recent 4D reconstruction methods have focused on low-overlap settings, yet they still produce noticeable artifacts in under-observed regions. Video diffusion models have emerged as another option, but they show geometrically inconsistent results for humans. To address these limitations, we propose StudioRecon, a pipeline that reconstructs 4D human scenes from sparse, low-overlap cameras by decoupling background and humans. We densify background supervision by synthesizing hundreds of camera-controlled novel views with a video diffusion model. We also robustly initialize deformable Gaussian humans with cross-view identity association and triangulated multi-view keypoint fitting. Finally, our recursive enhancement module with motion-adaptive consistency injection harmonizes the composed output, thereby further avoiding remaining artifacts. We achieve state-of-the-art novel view synthesis across four real-world datasets and demonstrate applications such as novel trajectory rendering and human replacement.