Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF

📄 arXiv: 2607.07693v1 📥 PDF

作者: Eric Zhu, Abhinav Shrivastava, Soumik Mukhopadhyay

分类: cs.LG, cs.AI, cs.CV

发布日期: 2026-07-08

备注: 19 pages, 18 figures, 4 tables. Submission under review. A shorter, non-archival 4-page abstract version of this work was accepted to CVPR 2026 Workshops (GCV, CVEU)


💡 一句话要点

提出选择性时间步加权和基于优势的重放以提高扩散RLHF的样本效率

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 人类反馈强化学习 扩散模型 样本效率 策略优化 重放机制 去噪时间步 信息丰富轨迹

📋 核心要点

  1. 现有的扩散RLHF方法在反馈效率上存在显著不足,通常需要大量的人类反馈或奖励模型评估。
  2. 本文提出了选择性时间步加权和基于优势的重放机制,以提高扩散RLHF的反馈效率,强调信息丰富的时间步和轨迹。
  3. 在相同的超参数设置下,提出的方法在样本效率上相比于现有基线有高达6倍的提升,显示出显著的效果。

📝 摘要(中文)

人类反馈强化学习(RLHF)已成为将生成模型与人类偏好对齐的强大范式。然而,将RLHF应用于扩散模型时,反馈效率低下,现有方法通常需要大量的人类或奖励模型评估。为了解决这一问题,本文提出了两种互补策略,显著提高了扩散RLHF的反馈效率,同时保持对未见提示的泛化能力。我们的关键观察是,扩散轨迹中的奖励信息分布不均,不是所有去噪时间步或轨迹对学习奖励信号的贡献都是相同的。通过在优化过程中强调信息丰富的时间步和轨迹,我们获得了更有效的梯度更新。我们的方案在相同超参数设置下,与广泛使用的扩散RLHF基线相比,样本效率提高了多达6倍。

🔬 方法详解

问题定义:本文旨在解决扩散模型在应用人类反馈强化学习时反馈效率低下的问题。现有方法通常依赖大量的反馈评估,限制了其在实际应用中的可行性。

核心思路:论文提出通过选择性地加权去噪时间步和重放信息丰富的轨迹来优化学习过程,从而提高反馈效率。这种设计旨在利用奖励信息的不均匀分布,强调对学习贡献大的部分。

技术框架:整体架构包括两个主要模块:第一,基于时间步的加权机制,在策略优化过程中对去噪步骤进行重加权;第二,重放机制优先选择信息丰富的轨迹,使模型能够重用过去的样本,而不是反复查询新的奖励。

关键创新:最重要的创新点在于引入了针对每个时间步的加权方案,并将其与近端策略优化(PPO)的最优收敛性质理论联系起来。这一方法与现有的RLHF方法在反馈利用上有本质区别。

关键设计:在参数设置上,采用了针对去噪步骤的动态加权策略,并设计了重放机制以优先考虑信息丰富的轨迹。损失函数和网络结构的具体细节在实验中进行了验证,以确保优化过程的有效性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,提出的方法在样本效率上相比于广泛使用的扩散RLHF基线有高达6倍的提升。这一显著的性能改进展示了选择性时间步加权和基于优势的重放机制在实际应用中的潜力。

🎯 应用场景

该研究的潜在应用领域包括生成模型的训练和优化,尤其是在需要人类反馈的场景中,如内容生成、对话系统和个性化推荐等。通过提高反馈效率,研究成果能够使这些应用在实际环境中更具可行性和实用性,推动人机交互的进一步发展。

📄 摘要(原文)

Reinforcement learning from human feedback (RLHF) has emerged as a powerful paradigm for aligning generative models with human preferences. However, applying RLHF to diffusion models remains highly feedback inefficient, as existing approaches typically require large amounts of human or reward model evaluations. This limitation reduces the practicality of diffusion RLHF in realworld settings where feedback is the primary bottleneck. In this paper, we propose two complementary strategies that substantially improve the feedback efficiency of diffusion RLHF while preserving generalization to unseen prompts. Our key observation is that reward information in diffusion trajectories is unevenly distributed: not all denoising timesteps or trajectories contribute equally to learning from a reward signal. By emphasizing informative timesteps and trajectories during optimization, we obtain more effective gradient updates. First, we introduce a per-timestep weighting scheme that reweights denoising steps during policy optimization. We theoretically connect this weighting to the optimal convergence properties of proximal policy optimization (PPO) and approximate the resulting weighting trend empirically. Second, we introduce a replay mechanism that prioritizes informative trajectories, enabling the model to reuse past samples instead of repeatedly querying new rewards. Together, these strategies significantly improve the feedback efficiency of diffusion RLHF. Under identical hyperparameter settings, our approach achieves up to a 6$\times$ improvement in sample efficiency compared to widely used diffusion RLHF baselines.