Generalizing Preference-based Reinforcement Learning: a Rationality Model for Incomparability
作者: Simone Drago, Marco Mussi, Leonardo Bianconi, Alberto Maria Metelli
分类: cs.LG
发布日期: 2026-07-13
💡 一句话要点
提出一种理性模型以解决轨迹比较中的不可比性问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 强化学习 偏好学习 轨迹比较 不可比性 多维奖励函数 专家反馈 Bradley-Terry模型
📋 核心要点
- 现有的偏好基强化学习方法未能处理专家标记的不可比轨迹对,限制了其应用范围。
- 论文提出了一种新的理性模型,能够有效捕捉不可比性,并推断出多维奖励函数。
- 实验结果表明,该模型能够在模拟环境中重建专家的奖励函数,并成功恢复政策的帕累托前沿。
📝 摘要(中文)
本研究探讨了基于人类专家提供的成对轨迹比较的强化学习(RL)问题。我们通过形式化一种新颖的设置来推广偏好基RL,其中专家可以将轨迹对标记为不可比,即当一个轨迹不优于另一个轨迹时。我们引入了学习问题及其解决方案应满足的期望,并提出了一种新的受Bradley-Terry启发的理性模型,有效捕捉不可比性并推断多维奖励函数,同时研究其性质。我们还提供了在数据集可用时学习模型参数的样本复杂性分析,并评估模型在模拟环境中重建与专家比较一致的奖励函数的能力,以及在不同专家理性水平下的鲁棒性分析。
🔬 方法详解
问题定义:本论文旨在解决在强化学习中如何处理人类专家提供的不可比轨迹对的问题。现有方法通常只考虑可比的轨迹对,导致无法充分利用专家的比较信息。
核心思路:论文提出了一种新的理性模型,灵感来源于Bradley-Terry模型,能够有效地捕捉轨迹间的不可比性,并推断出多维的奖励函数。这种设计使得模型能够更全面地反映专家的偏好。
技术框架:整体架构包括数据收集、轨迹比较标记、模型训练和奖励函数推断几个主要模块。首先,专家对轨迹对进行标记,然后利用这些标记训练理性模型,最后推断出与专家偏好一致的奖励函数。
关键创新:最重要的技术创新在于引入了不可比性概念,并通过Bradley-Terry启发的模型进行建模。这与现有方法的本质区别在于,后者通常只处理可比的轨迹对,无法有效利用不可比信息。
关键设计:模型的关键设计包括损失函数的选择,确保在训练过程中能够同时考虑可比和不可比的轨迹对。此外,模型参数的学习采用了样本复杂性分析,以优化学习效率。具体的网络结构和参数设置在实验部分进行了详细描述。
🖼️ 关键图片
📊 实验亮点
实验结果显示,所提出的模型在重建奖励函数方面表现优异,能够与专家的比较高度一致。在不同的专家理性水平下,模型的鲁棒性分析也表明其在多种情况下均能有效恢复政策的帕累托前沿,提升了策略选择的质量。
🎯 应用场景
该研究的潜在应用领域包括机器人学习、自动驾驶、游戏AI等需要人类专家反馈的强化学习场景。通过有效处理不可比性,该模型能够提升智能体的决策能力,进而在复杂环境中实现更优的策略选择,具有重要的实际价值和未来影响。
📄 摘要(原文)
In this work, we study the reinforcement learning (RL) problem from pairwise trajectory comparisons provided by a human expert. We generalize preference-based RL by formalizing a novel setting in which the expert can also label trajectory pairs as incomparable, i.e., when neither trajectory dominates the other. We introduce the learning problem and the desiderata that its solution should satisfy. Then, we propose a novel Bradley-Terry-inspired rationality model that effectively captures incomparabilities and infers a multi-dimensional reward function, and we study its properties. We provide a sample complexity analysis for learning the model parameters when a dataset is available. Finally, we evaluate our model's ability to reconstruct a reward function that aligns with the expert's comparisons in simulated environments and to recover the Pareto frontier of policies, along with a robustness analysis across varying levels of expert rationality.