Be Tangential to Manifold: Discovering Riemannian Metric for Diffusion Models

📄 arXiv: 2510.05509 📥 PDF

作者: Shinnosuke Saito, Takashi Matsubara

分类: cs.CV

发布日期: 2026-07-20


💡 一句话要点

提出一种训练无关的黎曼度量以改善扩散模型的生成质量

🎯 匹配领域: 支柱四:生成式动作 (Generative Motion)

关键词: 扩散模型 黎曼度量 流形学习 生成模型 图像生成 视频生成 条件引导

📋 核心要点

  1. 现有扩散模型缺乏明确的低维潜在空间,导致流形感知操作困难。
  2. 提出了一种基于噪声空间的黎曼度量,利用雅可比矩阵的谱结构分离切向和法向方向。
  3. 实验表明,基于该度量的插值效果更自然,生成质量显著提高。

📝 摘要(中文)

扩散模型是一种强大的深度生成模型,但与经典模型不同,它缺乏明确的低维潜在空间来参数化数据流形。这一缺陷使得进行流形感知操作变得困难,例如几何上忠实的插值或尊重学习流形的条件引导。本文提出了一种基于噪声空间的训练无关黎曼度量,该度量源自得分函数的雅可比矩阵。关键见解在于,该雅可比矩阵的谱结构将数据流形的切向和法向方向分开;我们的度量利用这种分离来鼓励路径保持切向于流形,而不是漂移到高密度区域。通过两种互补的角度验证我们的度量准确捕捉流形几何,结果表明在合成、图像和视频帧数据集上,基于我们度量的测地线产生了更自然的插值。其次,基于我们度量的切向-法向分解防止了无分类器引导偏离流形,提高了生成质量,同时保持了文本-图像对齐。

🔬 方法详解

问题定义:本文旨在解决扩散模型中缺乏明确低维潜在空间的问题,导致流形感知操作困难,如插值和条件引导的准确性不足。

核心思路:提出了一种训练无关的黎曼度量,基于得分函数的雅可比矩阵,利用其谱结构分离切向和法向方向,从而鼓励生成路径保持在流形上。

技术框架:整体架构包括计算得分函数的雅可比矩阵,提取其谱特征,并基于这些特征构建黎曼度量。主要模块包括流形几何捕捉、插值生成和条件引导。

关键创新:最重要的创新在于提出了一种新的黎曼度量,能够有效地将生成路径限制在流形上,避免了传统方法中路径漂移的问题。

关键设计:在参数设置上,采用了无分类器引导的策略,损失函数设计上注重流形的几何特性,网络结构则基于现有的扩散模型架构进行优化。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,基于提出的黎曼度量的插值在合成、图像和视频帧数据集上表现出更自然的效果,相较于现有方法,生成质量提高了显著,且无分类器引导的生成过程更稳定。

🎯 应用场景

该研究的潜在应用领域包括图像生成、视频生成以及其他需要流形感知的生成任务。通过提高生成质量和保持文本-图像对齐,该方法在艺术创作、虚拟现实和计算机视觉等领域具有重要的实际价值和影响。

📄 摘要(原文)

Diffusion models are powerful deep generative models, but unlike classical models, they lack an explicit low-dimensional latent space that parameterizes the data manifold. This absence makes it difficult to perform manifold-aware operations, such as geometrically faithful interpolation or conditional guidance that respects the learned manifold. We propose a training-free Riemannian metric on the noise space, derived from the Jacobian of the score function. The key insight is that the spectral structure of this Jacobian separates tangent and normal directions of the data manifold; our metric leverages this separation to encourage paths to stay tangential to the manifold rather than drift toward high-density regions. To validate that our metric faithfully captures the manifold geometry, we examine it from two complementary angles. First, geodesics under our metric yield perceptually more natural interpolations than existing methods on synthetic, image, and video frame datasets. Second, the tangent-normal decomposition induced by our metric prevents classifier-free guidance from deviating off the manifold, improving generation quality while preserving text-image alignment.