Inference-Time Nash Alignment
作者: Hadi Hosseini, Debmalya Mandal, Duohan Zhang
分类: cs.AI
发布日期: 2026-09-08
💡 一句话要点
提出推理时纳什对齐方法以解决偏好微调问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 推理时对齐 纳什均衡 偏好微调 博弈论 机器学习
📋 核心要点
- 现有的偏好微调方法依赖于大量计算资源和偏好数据集,且需要直接访问模型参数,存在一定局限性。
- 本文提出了在一般偏好下的推理时对齐方法,形式化为两个玩家的零和博弈,通过求解纳什均衡来实现。
- 实验结果表明,提出的BoN和NMD算法在多个数据集上显著提升了模型性能,接近微调模型的效果。
📝 摘要(中文)
偏好基础的微调方法如RLHF和DPO需要大量计算资源和偏好数据集,并且需要直接访问模型参数,而许多先进模型并不提供这些参数。推理时对齐提供了一种无需更新模型参数的经济有效替代方案。然而,现有的推理时方法依赖于基于Bradley-Terry假设的标量奖励模型,无法表示一般偏好。本文首次研究在一般偏好下的推理时对齐问题,将其形式化为两个玩家零和博弈的纳什均衡。我们提出了两种算法:Best-of-Nash (BoN)和Nash Mirror Descent (NMD),并证明这两种算法的对偶间隙与问题下界相匹配。实验证明,我们的方法在三个数据集上显著优于基础策略,收敛到微调模型的性能,并且NMD在正则化参数上保持稳健性。
🔬 方法详解
问题定义:本文旨在解决现有偏好微调方法在计算资源和数据集需求上的不足,尤其是对模型参数的直接访问限制。推理时对齐作为一种替代方案,能够在不更新模型参数的情况下进行优化。
核心思路:论文的核心思路是将推理时对齐问题形式化为两个玩家的零和博弈,通过求解纳什均衡来实现对齐。这种方法能够更好地处理一般偏好,而不仅限于传统的标量奖励模型。
技术框架:整体架构包括两个主要算法:Best-of-Nash (BoN)和Nash Mirror Descent (NMD)。这两个算法通过不同的方式实现纳什均衡,确保在推理时进行有效的偏好对齐。
关键创新:最重要的技术创新在于首次将推理时对齐与一般偏好结合,提出了基于博弈论的解决方案,突破了现有方法的局限性。
关键设计:在算法设计中,BoN和NMD的损失函数和正则化参数设置经过精心调整,以确保算法的收敛性和鲁棒性,特别是在不同数据集上的表现。通过理论证明,算法的对偶间隙与问题下界相匹配,确保了方法的有效性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,提出的BoN和NMD算法在三个数据集上显著优于基础策略,收敛到微调模型的性能,具体提升幅度达到了XX%。此外,NMD在不同正则化参数下表现出良好的鲁棒性,验证了其在实际应用中的有效性。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理、推荐系统和人机交互等场景,能够为模型的偏好微调提供一种高效的解决方案。通过推理时对齐,模型能够更好地适应用户的个性化需求,提升用户体验。未来,这种方法可能会在更广泛的AI应用中发挥重要作用。
📄 摘要(原文)
Preference-based fine-tuning methods such as RLHF and DPO require substantial compute and large preference datasets. They also need direct access to the model parameters which are not provided by many state-of-the art models. Inference-time alignment offers a cost-effective alternative without updating model parameters. However, existing inference-time methods rely on a scalar reward model derived under a Bradley-Terry assumption, which cannot represent general preferences. Following recent work on fine-tuning with generalized preferences, in this work, we initiate the study of inference-time alignment under general preferences. We formulate the problem as obtaining a Nash equilibrium of a two-player zero-sum game between policies. We propose two algorithms: Best-of-Nash (BoN) and Nash Mirror Descent (NMD). We prove that both algorithms achieve a duality gap that matches the problem lower bound. Empirically, we implement the two methods on three datasets, which shows that our methods substantially outperform the base policy, converging to the performance of the fine-tuned models. Moreover, our results show that NMD remains robust across the regularization parameter.