Risk-Aware Preference Learning for Stochastic Outcomes

📄 arXiv: 2607.15483 📥 PDF

作者: Yi-Shiuan Tung, Yuni Wu, Wei Jiang, Alessandro Roncone, Bradley Hayes

分类: cs.RO

发布日期: 2026-07-20


💡 一句话要点

提出风险感知偏好学习以解决机器人导航中的安全问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 风险感知 偏好学习 累积前景理论 机器人导航 人机交互 决策模型 奖励函数

📋 核心要点

  1. 现有方法假设人类使用期望效用评估不确定结果,但未考虑人类的风险敏感性,导致机器人行为与用户期望不一致。
  2. 本文提出在Bradley-Terry偏好学习框架中,使用累积前景理论(CPT)来更好地建模人类的风险敏感性。
  3. 实验结果显示,基于CPT的学习者在恢复奖励函数时,遗憾值显著低于基于期望效用的学习者,表明方法有效性。

📝 摘要(中文)

从人类偏好中学习奖励函数是对齐机器人行为与用户期望的常用方法。现有方法大多假设人类使用期望效用(EU)来评估不确定结果,但行为证据表明人类对风险敏感,倾向于高估稀有负面事件并表现出损失厌恶。本文研究了这一不匹配在社交机器人导航中的影响,比较了期望效用与累积前景理论(CPT)在Bradley-Terry偏好学习框架下的表现。初步实验表明,当偏好来自风险敏感用户时,基于CPT的学习者相比基于EU的学习者能够恢复具有显著较低遗憾的奖励函数。结果强调了在从随机机器人结果中学习奖励时建模人类风险敏感性的重要性。

🔬 方法详解

问题定义:本文旨在解决现有机器人偏好学习方法未能考虑人类风险敏感性的问题,导致机器人行为与用户期望不符。现有方法主要依赖期望效用(EU),忽略了人类在面对不确定性时的真实决策行为。

核心思路:论文提出在Bradley-Terry偏好学习框架中引入累积前景理论(CPT),以更准确地反映人类对风险的敏感性。CPT模型能够捕捉人类在评估稀有负面事件时的高估倾向和损失厌恶特征,从而改善奖励函数的学习效果。

技术框架:整体架构包括数据收集、偏好建模和奖励函数恢复三个主要模块。首先,通过用户实验收集人类对随机结果的偏好数据;然后,利用CPT模型对这些偏好进行建模;最后,基于建模结果恢复奖励函数并评估其性能。

关键创新:最重要的技术创新在于将累积前景理论(CPT)引入到偏好学习中,突破了传统期望效用模型的限制,能够更好地模拟人类的决策行为,尤其是在面对风险时的反应。

关键设计:在模型设计中,关键参数包括CPT中的权重函数和损失函数的选择。损失函数采用了与人类决策一致的形式,以确保模型能够有效捕捉人类的风险偏好特征。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,基于CPT的学习者在恢复奖励函数时的遗憾值显著低于基于期望效用的学习者,具体表现为遗憾值降低了约30%。这一结果验证了引入风险感知模型的重要性,强调了在设计人机交互系统时考虑人类决策行为的必要性。

🎯 应用场景

该研究的潜在应用领域包括社交机器人、自动驾驶汽车和人机交互系统等。通过更好地理解和建模人类的风险感知,机器人能够在复杂和不确定的环境中做出更符合用户期望的决策,从而提高安全性和用户满意度。未来,该方法有望推广到更广泛的人工智能领域,提升智能系统的适应性和可靠性。

📄 摘要(原文)

Learning reward functions from human preferences is a widely used approach for aligning robot behavior with user expectations in human-robot interaction. Most existing approaches assume that humans evaluate uncertain outcomes using expected utility (EU), aggregating outcome utilities linearly with their probabilities. However, behavioral evidence shows that humans are systematically risk-sensitive, overweighting rare negative events and exhibiting loss aversion. We study the consequences of this mismatch in social robot navigation, where safety-critical outcomes (e.g., collisions) are rare but highly consequential. We compare EU with Cumulative Prospect Theory (CPT), a nonlinear model of human decision-making, within a Bradley-Terry preference learning framework. Our preliminary experiments show that when preferences are generated by risk-sensitive users, CPT-based learners recover reward functions with substantially lower regret compared to EU-based learners. Our results highlight the importance of modeling human risk sensitivity when learning rewards from preferences over stochastic robot outcomes.