Context-weighted Discrete Flow Matching

📄 arXiv: 2607.21427v1 📥 PDF

作者: Daniil Cherniavskii, Daniel Severo, Karen Ullrich

分类: cs.LG

发布日期: 2026-07-23

备注: Under review at NeurIPS 2026


💡 一句话要点

提出上下文加权离散流匹配以提升生成模型性能

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 离散流匹配 生成模型 上下文加权 马尔可夫链 自然语言处理

📋 核心要点

  1. 现有的离散流匹配方法在训练过程中面临不同难度目标的混合,导致生成质量不稳定。
  2. 论文提出了一种上下文加权的采样器,通过引入局部上下文信息来改善生成质量。
  3. 实验结果显示,该方法在OpenWebText数据集上将生成困惑度降低了63%,并与强基线相当。

📝 摘要(中文)

离散流匹配为离散结构的生成建模提供了灵活的框架。然而,标准的分解训练目标使模型面临不同难度的目标,混合了良好条件的可预测标记与模糊的高熵标记。我们通过实验证明,每个标记的值的不确定性与其邻域中可用上下文的密度密切相关。基于这一观察,我们提出了一种对基础连续时间马尔可夫链(CTMC)的简单修改,融入局部上下文信息。我们的上下文加权采样器在几乎没有计算开销的情况下提高了生成质量,而缩放的交叉熵损失函数重新加权了来自不同标记的训练信号,并在OpenWebText上将生成困惑度降低了63%。此外,我们的方法在质量上与强大的半自回归块扩散基线相匹配,同时保留了以任意顺序进行生成的能力。这些结果突显了局部上下文在离散生成建模中的重要作用,并表明简单的上下文感知修改可以显著提高采样和训练效率。

🔬 方法详解

问题定义:论文要解决的问题是现有离散流匹配方法在训练过程中因目标难度不均而导致的生成质量不稳定。现有方法未能有效利用局部上下文信息,造成生成的不确定性和困惑度较高。

核心思路:论文的核心思路是通过修改连续时间马尔可夫链(CTMC),引入局部上下文信息来加权采样,从而提升生成质量。这样的设计旨在利用周围上下文的密度来降低生成的不确定性。

技术框架:整体架构包括上下文加权采样器和缩放交叉熵损失函数。上下文加权采样器在生成过程中考虑邻域信息,而损失函数则重新加权不同标记的训练信号,以提高训练效率。

关键创新:最重要的技术创新点在于引入上下文加权机制,使得模型能够更好地利用局部信息,从而显著降低生成困惑度。这与传统方法的单一目标训练方式形成鲜明对比。

关键设计:关键设计包括上下文加权采样器的实现细节,以及缩放交叉熵损失函数的具体形式。通过这些设计,模型能够在保持计算效率的同时,显著提升生成质量。具体参数设置和网络结构细节在论文中有详细描述。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,提出的方法在OpenWebText数据集上将生成困惑度降低了63%,并且在生成质量上与强大的半自回归块扩散基线相当。这一显著提升展示了上下文加权在离散生成建模中的重要性。

🎯 应用场景

该研究的潜在应用领域包括自然语言生成、对话系统和文本摘要等。通过提升生成模型的性能,能够在实际应用中提供更高质量的生成结果,进而改善用户体验。未来,该方法的上下文感知特性可能会推动更多领域的生成模型研究与应用。

📄 摘要(原文)

Discrete flow matching provides a flexible framework for generative modeling on discrete structures. However, the standard factorized training objective exposes the model to targets of varying difficulty, mixing well-conditioned, predictable tokens with ambiguous, high-entropy ones. We empirically demonstrate that the uncertainty over the value of each token is closely related to the density of available context in its neighborhood. Motivated by this observation, we propose a simple modification to the underlying continuous-time Markov chain (CTMC) that incorporates local context information. Our context-weighted sampler improves generation quality with negligible computational overhead, while our scaled cross-entropy loss function reweights the training signal from different tokens and reduces generative perplexity by up to 63% on OpenWebText. Moreover, our approach matches a strong semi-autoregressive block diffusion baseline in quality while retaining the ability to perform generation in any order. These results highlight the role of local context as an important factor in discrete generative modeling and show that simple context-aware modifications can significantly improve both sampling and training efficiency.