FlexiAvatar: Unified 3D Gaussian Human Avatars Under Arbitrary Body Visibility
作者: Yihalem Yimolal Tiruneh, Muhammad Salman Ali, Uyoung Jeong, Muneeb A. Khan, MD Khalequzzaman Chowdhury Sayem, Allanur Bayramgeldiyev, Binod Bhattarai, Seungryul Baek
分类: cs.CV
发布日期: 2026-07-21
备注: Accepted in ECCV 2026
💡 一句话要点
提出FlexiAvatar以解决单目视频中3D人类头像重建问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics) 支柱六:视频提取与匹配 (Video Extraction)
关键词: 3D人类头像 单目视频重建 增强现实 虚拟现实 高斯点云 深度学习 计算机视觉
📋 核心要点
- 现有方法在重建可动画3D人类头像时,通常会导致可见区域的重建质量下降,尤其是在处理遮挡时。
- FlexiAvatar通过仅优化可见身体区域,结合抗遮挡的SMPL-X跟踪和残差细化,显著提高了重建质量。
- 实验结果显示,FlexiAvatar在多个数据集上平均PSNR提升约3%,并减少了部分可见场景中的运行时和内存开销。
📝 摘要(中文)
重建可动画的3D人类头像是计算机视觉中的一个基本问题,广泛应用于增强现实和数字内容创作。现有方法通常将参数化身体模型与神经渲染或3D高斯点云结合,联合优化所有身体区域,导致可见区域的重建质量下降。为了解决这一问题,本文提出了FlexiAvatar,一个统一框架,明确优化可见身体区域,有效消除未观察到的肢体带来的伪影。该方法结合了抗遮挡的SMPL-X跟踪与特定部位的残差细化,以捕捉高频几何和外观细节。通过扩散方法生成与观察到的外观一致的纹理,完成完全未见区域的重建。实验表明,FlexiAvatar在多个数据集上显著提高了重建质量,平均PSNR提升约3%。
🔬 方法详解
问题定义:本文旨在解决从单目视频中重建3D人类头像的挑战,现有方法在处理遮挡和未观察区域时,重建质量往往受到影响。
核心思路:FlexiAvatar的核心思路是仅优化可见的身体区域,从而避免未观察到的肢体造成的伪影,并通过扩散方法生成一致的纹理来填补未见区域。
技术框架:该方法包括抗遮挡的SMPL-X跟踪模块和特定部位的残差细化模块,整体流程为:首先进行身体跟踪,然后对可见区域进行优化,最后生成未见区域的纹理。
关键创新:FlexiAvatar的创新之处在于其优化策略,明确区分可见和不可见区域的处理,显著提高了重建的细节和一致性。
关键设计:在参数设置上,采用了特定的损失函数来平衡可见区域和未见区域的重建质量,同时在网络结构中引入了残差学习以捕捉高频细节。
🖼️ 关键图片
📊 实验亮点
实验结果表明,FlexiAvatar在多个数据集上表现优异,平均PSNR提升约3%,超越了现有最先进的方法。此外,通过优化可见区域,显著降低了部分可见场景中的计算时间和内存开销,提升了实用性。
🎯 应用场景
FlexiAvatar在增强现实、虚拟现实和数字内容创作等领域具有广泛的应用潜力。通过提高3D人类头像的重建质量,该技术可以为游戏开发、影视制作和社交媒体等行业提供更真实的用户体验,未来可能推动相关技术的进一步发展与应用。
📄 摘要(原文)
Reconstructing animatable 3D human avatars from monocular video is a fundamental problem in computer vision with broad applications in AR/VR and digital content creation. Existing approaches typically couple parametric body models with neural rendering or 3D Gaussian splatting and optimize all body regions jointly from short videos, which often degrades fidelity in the visible areas. To overcome this limitation, we introduce FlexiAvatar, a unified framework that explicitly optimizes only the visible body regions, effectively eliminating artifacts arising from unobserved limbs. Our method integrates occlusion-robust SMPL-X tracking with part-specific residual refinement to capture high-frequency geometric and appearance details. To complete entirely unseen regions (e.g., back views), we leverage a diffusion-based approach to generate texture consistent with the observed appearance. Experiments on full-body (NeuMan, ZJU-MoCap, WildAvatar), upper/half-body (talk-show clips), and head-only (INSTA) inputs show that FlexiAvatar delivers consistently higher reconstruction quality, outperforming state-of-the-art methods by an average PSNR improvement of approximately 3% across datasets. Finally, by restricting optimization to observed regions, our method reduces the effective number of Gaussians that must be optimized and rendered, leading to reduced runtime and memory overhead in partial-visibility scenarios.