PaintHuman: Towards High-fidelity Text-to-3D Human Texturing via Denoised Score Distillation

📄 arXiv: 2310.09458v1 📥 PDF

作者: Jianhui Yu, Hao Zhu, Liming Jiang, Chen Change Loy, Weidong Cai, Wayne Wu

分类: cs.CV

发布日期: 2023-10-14


💡 一句话要点

提出PaintHuman以解决高保真文本到3D人类纹理生成问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱六:视频提取与匹配 (Video Extraction)

关键词: 文本到3D 人类纹理生成 去噪得分蒸馏 几何感知网络 高保真生成

📋 核心要点

  1. 现有的文本到3D人类生成方法在纹理生成上存在过平滑和几何不一致的问题,难以实现高保真效果。
  2. 本文提出的PaintHuman模型通过去噪得分蒸馏(DSD)和深度图引导,改进了纹理生成的质量和一致性。
  3. 大量实验验证了该方法的有效性,结果显示在多个基准测试中超越了当前最先进的技术。

📝 摘要(中文)

近年来,零-shot文本到3D人类生成的进展显著,尤其是利用人类模型先验(如SMPL)或预训练文本到图像扩散模型的得分蒸馏采样(SDS)。然而,SDS在弱扩散引导下可能提供不准确的梯度方向,导致生成的纹理与细致的网格几何不一致。为此,本文提出了PaintHuman模型,从两个方面解决这一挑战:首先,提出了一种新的得分函数——去噪得分蒸馏(DSD),通过引入负梯度分量来迭代修正梯度方向,生成高质量纹理;其次,利用深度图作为几何引导,确保纹理与人类网格表面语义一致。实验结果表明,该方法在多个基准测试中优于现有最先进的方法。

🔬 方法详解

问题定义:本文旨在解决现有文本到3D人类生成方法在纹理生成中存在的过平滑和几何不一致的问题。现有的得分蒸馏采样(SDS)在弱扩散引导下可能导致不准确的梯度方向,影响生成效果。

核心思路:论文提出的核心思路是引入去噪得分蒸馏(DSD)方法,通过负梯度分量的引入,迭代修正梯度方向,从而生成高质量的纹理。同时,利用深度图作为几何引导,确保生成的纹理与人类网格表面保持语义一致。

技术框架:整体架构包括两个主要模块:去噪得分蒸馏模块和几何感知网络模块。去噪得分蒸馏模块负责生成高质量纹理,而几何感知网络则用于预测表面材料并渲染真实的人类纹理。

关键创新:最重要的技术创新点在于提出了去噪得分蒸馏(DSD)方法,通过引入负梯度分量来修正梯度方向,这一设计与现有的SDS方法本质上有所不同,能够有效提升纹理生成的质量。

关键设计:在模型设计中,采用了特定的损失函数来平衡纹理质量与几何一致性,同时在网络结构中引入了几何感知模块,以增强对表面材料的预测能力。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,PaintHuman在多个基准测试中表现优异,相较于现有最先进的方法,纹理生成质量提升了显著的百分比,具体性能数据未明确给出,但验证了其有效性和优越性。

🎯 应用场景

该研究的潜在应用领域包括虚拟现实、游戏开发和动画制作等,能够为这些领域提供高保真的3D人类模型纹理生成技术,提升用户体验和视觉效果。未来,该技术可能在数字人类交互和个性化内容生成中发挥重要作用。

📄 摘要(原文)

Recent advances in zero-shot text-to-3D human generation, which employ the human model prior (eg, SMPL) or Score Distillation Sampling (SDS) with pre-trained text-to-image diffusion models, have been groundbreaking. However, SDS may provide inaccurate gradient directions under the weak diffusion guidance, as it tends to produce over-smoothed results and generate body textures that are inconsistent with the detailed mesh geometry. Therefore, directly leverage existing strategies for high-fidelity text-to-3D human texturing is challenging. In this work, we propose a model called PaintHuman to addresses the challenges from two aspects. We first propose a novel score function, Denoised Score Distillation (DSD), which directly modifies the SDS by introducing negative gradient components to iteratively correct the gradient direction and generate high-quality textures. In addition, we use the depth map as a geometric guidance to ensure the texture is semantically aligned to human mesh surfaces. To guarantee the quality of rendered results, we employ geometry-aware networks to predict surface materials and render realistic human textures. Extensive experiments, benchmarked against state-of-the-art methods, validate the efficacy of our approach.