DreamStyle3D: Efficient 3D Stylized Asset Generation via Dual-Attention Disentanglement

📄 arXiv: 2607.24721v1 📥 PDF

作者: Kai Wang, Ziheng Ouyang, Xuying Zhang, Ming-Ming Cheng, Qibin Hou

分类: cs.CV

发布日期: 2026-07-27

备注: ACM MM 2026

DOI: 10.1145/3767308.3835473

🔗 代码/项目: GITHUB


💡 一句话要点

提出DreamStyle3D以解决高效生成3D风格化资产问题

🎯 匹配领域: 支柱七:动作重定向 (Motion Retargeting)

关键词: 3D风格化 生成模型 计算机视觉 深度学习 风格一致性

📋 核心要点

  1. 现有方法在风格保真度、几何一致性和生成效率方面存在不足,尤其依赖间接的2D到3D风格化流程。
  2. 提出DreamStyle3D框架,通过解耦双重交叉注意力机制,明确分离几何和风格特征,实现高效风格注入。
  3. 实验表明,DreamStyle3D在10秒内生成高保真、几何一致的风格化3D资产,显著提升了生成效率和风格质量。

📝 摘要(中文)

随着游戏、动画和虚拟现实产业的快速发展,对高效生成风格化3D资产的需求日益增加。然而,现有方法在风格保真度、几何一致性和生成效率方面仍存在挑战,尤其是大多数依赖间接的2D到3D风格化流程。为此,本文提出了DreamStyle3D,一个基于解耦双重交叉注意力机制的高效3D风格化资产生成框架。该方法明确分离几何特征和风格特征,实现高效的风格注入,同时保持结构一致性。此外,构建了一个自动化数据管道,并创建了约15K的内容-风格-风格化三元组数据集用于训练和评估。实验结果表明,DreamStyle3D能够在10秒内生成高保真、几何一致的风格化3D资产,显著提高了效率,同时保持优越的风格质量,为3D内容创作提供了新解决方案。

🔬 方法详解

问题定义:本文旨在解决现有3D风格化资产生成方法在风格保真度、几何一致性和生成效率方面的不足,尤其是依赖于间接的2D到3D风格化流程所带来的问题。

核心思路:提出DreamStyle3D框架,通过解耦双重交叉注意力机制,明确分离几何特征和风格特征,以实现高效的风格注入,同时保持结构一致性。

技术框架:整体架构包括数据预处理、特征提取、风格注入和生成阶段。通过双重交叉注意力机制,分别处理几何和风格特征,确保生成的3D资产在风格和几何上都具备一致性。

关键创新:最重要的技术创新在于解耦风格与几何特征的能力,使得风格注入过程更加高效且不影响几何结构的完整性。这与现有方法的间接风格化流程形成了本质区别。

关键设计:在模型设计中,采用轻量级训练策略以增强风格一致性和模型泛化能力,同时设置了适当的损失函数以平衡风格和几何特征的生成。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,DreamStyle3D能够在10秒内生成高保真、几何一致的风格化3D资产,相较于传统方法,生成效率提升显著,同时在风格质量上也保持了优越性。这为3D内容创作提供了新的解决方案。

🎯 应用场景

该研究具有广泛的应用潜力,尤其在游戏开发、动画制作和虚拟现实内容创作领域。通过高效生成风格化3D资产,能够大幅度降低开发成本和时间,提高创作效率,推动相关产业的发展。未来,该技术可能会扩展到更多的3D内容生成任务,如建筑可视化和产品设计等。

📄 摘要(原文)

With the growth of gaming, animation, and virtual reality industries, the demand for efficient generation of stylized 3D assets is rapidly increasing. However, existing approaches still struggle to jointly preserve style fidelity, geometric consistency, and generation efficiency, as most of them still rely on indirect 2D-to-3D stylization pipelines. This motivates a native 3D stylization framework that can explicitly disentangle style from geometry while remaining efficient. To this end, we propose DreamStyle3D, an efficient framework for stylized 3D asset generation built on a Decoupled Dual Cross-Attention mechanism. Our method explicitly separates geometric and stylistic features to enable efficient style injection while preserving structural consistency, and further adopts a lightweight training strategy to enhance style consistency and model generalization. In addition, we build an automated data pipeline and construct a dataset of about 15K content-style-stylized triplets for training and evaluation. Extensive experiments demonstrate that our DreamStyle3D can generate high-fidelity, geometrically consistent stylized 3D assets within 10 seconds, substantially improving efficiency while maintaining superior style quality and offering a new solution for 3D content creation. The code and data are available at https://github.com/HVision-NKU/DreamStyle3D.