UVFaceFusion: Fast Multi-view Topologically Consistent Face Reconstruction in the Wild via UV-space Neural Fusion

📄 arXiv: 2607.18798v1 📥 PDF

作者: Xin Ming, Yuxuan Han, Junhai Yong, Feng Xu

分类: cs.CV, cs.GR

发布日期: 2026-07-21

🔗 代码/项目: GITHUB


💡 一句话要点

提出UVFaceFusion以解决高保真面部重建问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 面部重建 神经网络 UV空间 多视角融合 实时应用 数字头像 几何一致性

📋 核心要点

  1. 现有的面部重建方法在几何保真度和野外泛化能力之间存在显著的权衡,难以满足实际应用需求。
  2. UVFaceFusion通过在标准UV空间中进行可学习的神经融合,替代了传统的启发式拓扑优化,提升了重建效果。
  3. 在多个基准测试中,UVFaceFusion展示了优越的重建精度,且在处理速度上也有显著提升,适用于实时应用。

📝 摘要(中文)

高保真面部几何重建对于数字化头像创建和动画至关重要,但现有自动化方法往往在几何保真度和野外泛化之间存在权衡。本文提出UVFaceFusion,一个用于多视角、固定拓扑面部重建的前馈框架。其核心思想是用可学习的神经融合替代启发式拓扑优化。通过多视角图像,首先利用VGGT和Pixel3DMM分别获得每个视角的密集点图和面部UV对应关系。然后,将视角特定的点图提升到标准UV域,并通过新颖的掩码感知神经融合网络进行融合。尽管仅在Ava-256上训练,UVFaceFusion在多个公共基准和野外捕获中表现出良好的泛化能力。实验表明,UVFaceFusion在单个RTX 4090上以不到3秒的时间从16个输入视角重建网格,达到了最先进的重建精度。

🔬 方法详解

问题定义:本文旨在解决高保真面部几何重建中的拓扑一致性问题,现有方法往往在几何保真度与泛化能力之间存在权衡,导致在实际应用中效果不佳。

核心思路:UVFaceFusion的核心思路是通过在标准UV空间中进行可学习的神经融合,替代传统的启发式拓扑优化,从而提高重建的准确性和泛化能力。

技术框架:该方法的整体架构包括多个模块:首先从多视角图像中提取密集点图和面部UV对应关系,然后将这些视角特定的点图提升到标准UV域,最后通过掩码感知神经融合网络进行融合,生成完整的UV空间点图,并从中直接采样固定拓扑网格。

关键创新:UVFaceFusion的主要创新在于其采用的神经融合技术,能够有效减少对特定数据集外观和捕获条件的依赖,与现有方法相比,显著提升了重建的准确性和速度。

关键设计:在网络结构上,采用了掩码感知的设计,以增强对不同视角信息的融合能力;损失函数的设计也考虑了几何一致性和拓扑稳定性,以确保最终重建结果的高质量。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

UVFaceFusion在多个基准测试中表现出色,重建精度达到最先进水平,且在单个RTX 4090上从16个输入视角重建网格的时间少于3秒,显示出其在速度和准确性上的显著优势。

🎯 应用场景

该研究的潜在应用领域包括虚拟现实、游戏开发和数字化社交平台等,能够为用户提供更加真实和个性化的数字化头像。随着技术的进步,UVFaceFusion有望在实时面部重建和动画生成中发挥重要作用,进一步推动数字内容创作的发展。

📄 摘要(原文)

Reconstructing high-fidelity facial geometry with an assigned topology is essential for digital avatar creation and animation, yet existing automated methods often trade off geometric fidelity and in-the-wild generalization. We present UVFaceFusion, a feed-forward framework for multi-view, fixed-topology face reconstruction from daily images. Our key idea is to replace heuristic topological optimization with learnable neural fusion in a canonical UV space. Given multi-view images, we first obtain dense point maps and facial UV correspondences of each view using VGGT and Pixel3DMM, respectively. Then, the view-specific point maps are lifted into the canonical UV domain and fused with a novel mask-aware neural fusion network. The network predicts a complete UV-space point map, from which a fixed-topology mesh is directly sampled. Although trained only on Ava-256, UVFaceFusion generalizes well to multiple public benchmarks and in-the-wild captures, benefiting from its canonical UV-space geometry-to-geometry fusion that reduces dependence on dataset-specific appearance and capture conditions. Experiments on various benchmarks show that UVFaceFusion achieves state-of-the-art reconstruction accuracy while reconstructing a mesh from 16 input views in less than 3 seconds on a single RTX 4090. Code is available at https://github.com/grignarder/UVFaceFusion.