HaWMPO: Hallucination-Aware World Model-based Policy Optimization for Generalist Robot Policy

📄 arXiv: 2609.09941v1 📥 PDF

作者: Zengjue Chen, Peidong Liu, Jiawei Li, Qi Wang

分类: cs.RO

发布日期: 2026-09-09


💡 一句话要点

提出HaWMPO以解决长时间预测中的幻觉问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 长时间预测 幻觉感知 策略优化 机器人操作 强化学习

📋 核心要点

  1. 现有的视觉-语言-动作策略在复杂长时间场景中的成功率有限,且训练过程依赖昂贵的物理交互,样本效率低。
  2. HaWMPO通过引入幻觉感知模型,评估生成图像序列的可靠性,并在策略优化中抑制不可靠的动作块。
  3. 在LIBERO基准测试中,HaWMPO的平均成功率提高了15.0%,在真实世界实验中,成功率从67.5%提升至80.0%。

📝 摘要(中文)

通用机器人策略在机器人操作任务中表现出强大的泛化能力,但在复杂的长时间场景中成功率仍然有限。现有的视觉-语言-动作(VLA)策略通过在线强化学习进行改进,但这种训练依赖于昂贵的物理交互,样本效率低,并可能引入硬件和安全风险。世界模型提供了一种有前景的替代方案,但生成的长时间预测常常受到幻觉的影响,导致偏差的状态转移,从而误导策略学习。为了解决这一问题,本文提出了基于幻觉感知的世界模型策略优化(HaWMPO),它通过引入动作条件的幻觉感知模型来评估生成图像序列的可靠性,并通过奖励软机制将幻觉评分纳入相对策略优化,从而在训练过程中抑制不可靠的动作块。

🔬 方法详解

问题定义:本文旨在解决长时间预测中由于幻觉效应导致的策略学习偏差问题。现有方法在生成的状态转移中常常出现不可靠的预测,影响了策略的优化效果。

核心思路:HaWMPO的核心思路是引入一个动作条件的幻觉感知模型,以评估生成图像序列的可靠性,并通过奖励软机制将幻觉评分融入策略优化中,从而抑制不可靠的动作块。

技术框架:HaWMPO的整体架构包括数据收集、幻觉感知模型的训练、策略优化和闭环强化学习四个主要模块。首先,通过世界模型生成想象的状态转移,然后利用幻觉感知模型评估这些状态的可靠性,最后进行策略优化。

关键创新:HaWMPO的主要创新在于引入幻觉感知机制,使得在策略优化过程中能够动态评估和抑制不可靠的动作,从而提高了策略的学习效率和成功率。这与传统方法的静态评估方式形成了鲜明对比。

关键设计:在设计上,HaWMPO采用了奖励软机制来整合幻觉评分,并在训练过程中动态调整策略优化的权重。此外,模型的损失函数设计考虑了幻觉评分的影响,以确保训练过程的稳定性和有效性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

HaWMPO在LIBERO基准测试中实现了最佳的平均成功率,较基础模型提升了15.0%,较最强基线提升了2.8%。在真实世界实验中,G1机器人在两个操作任务上的成功率从67.5%提升至80.0%,验证了其有效性。

🎯 应用场景

该研究的潜在应用领域包括服务机器人、工业自动化和家庭助理等场景。通过提高机器人在复杂任务中的成功率,HaWMPO能够显著提升机器人在实际应用中的可靠性和安全性,推动智能机器人技术的进一步发展。

📄 摘要(原文)

Generalist robot policies have demonstrated strong generalization across robotic manipulation tasks, yet their success rates remain limited in com- plex long-horizon scenarios. Recent methods improve Visual-Language-Action (VLA) policies through online reinforcement learning on real robots, but such training relies on costly physical interactions, suffers from low sample efficiency, and may introduce hardware and safety risks. World models offer a promising alternative by enabling policy optimization with imagined rollouts. However, long-horizon rollouts generated by world models often suffer from prediction hal- lucinations, producing biased state transitions that can mislead policy learning. To address this issue, we propose Hallucination-aware World Model-based Pol- icy Optimization (HaWMPO), a closed-loop reinforcement learning pipeline for VLA policy post-training with world models. Specifically, HaWMPO introduces an action-conditioned hallucination-aware model to estimate the reliability of gen- erated image sequences, and incorporates hallucination scores into group relative policy optimization through a Reward-Soft mechanism, suppressing unreliable ac- tion chunks during training. On the LIBERO benchmark, HaWMPO achieves the best average success rate, with gains of 15.0% over the base model and 2.8% over the strongest baseline; real-world experiments on a G1 robot further validate its effectiveness, raising the average success rate on two manipulation tasks from 67.5% to 80.0%.