ObstaDiff: Generalizable Diffusion Policy Learning via Obstacle-aware Representations
作者: Jiawen Wang, Kevin Yao, Khalid Jawed
分类: cs.RO, cs.LG
发布日期: 2026-09-10
备注: Accepted to the 10th Conference on Robot Learning (CoRL 2026), Austin, TX, USA. 16 pages, 5 figures
💡 一句话要点
提出ObstaDiff以解决障碍物感知的模仿学习问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture) 支柱四:生成式动作 (Generative Motion) 支柱七:动作重定向 (Motion Retargeting) 支柱八:物理动画 (Physics-based Animation)
关键词: 模仿学习 障碍物感知 机器人操作 扩散策略 农业机器人
📋 核心要点
- 现有模仿学习方法在处理杂乱场景时,往往假设背景干净,缺乏对障碍物的感知能力,导致泛化能力不足。
- 本文提出ObstaDiff,通过分解的扩散策略框架和障碍物感知视觉编码器,提取目标、障碍物和背景的结构化表示。
- 在真实机器人温室试验中,ObstaDiff实现了75.41%的任务成功率和8.20%的障碍物碰撞率,显著优于现有基线方法。
📝 摘要(中文)
模仿学习在机器人操作中取得了显著成果,但大多数现有方法假设背景干净,缺乏针对障碍物的显式运动生成机制。将这些策略扩展到杂乱的现实场景中仍然是一个重要的泛化挑战。本文提出了ObstaDiff,一个分解的扩散策略框架,配备轻量级的障碍物感知视觉编码器。ObstaDiff提取结构化的目标-障碍物-背景表示,使下游对齐策略能够在考虑周围障碍物的情况下生成朝向目标中心瓶颈姿态的末端执行器轨迹。我们在61个真实机器人温室试验中评估了ObstaDiff,取得了75.41%的平均任务成功率和8.20%的平均障碍物碰撞率,超越了代表性的模仿学习基线,并改善了在杂乱农业场景中的泛化能力。
🔬 方法详解
问题定义:本文旨在解决现有模仿学习方法在杂乱环境中缺乏障碍物感知能力的问题。这些方法通常假设背景干净,导致在复杂场景中的泛化能力不足。
核心思路:ObstaDiff的核心思路是通过引入障碍物感知的视觉编码器,提取目标、障碍物和背景的结构化表示,从而使得生成的运动轨迹能够考虑周围障碍物的影响。
技术框架:ObstaDiff的整体架构包括三个主要模块:障碍物感知视觉编码器、目标对齐策略和轨迹生成模块。视觉编码器负责提取环境信息,目标对齐策略用于生成末端执行器的运动轨迹。
关键创新:ObstaDiff的主要创新在于其分解的扩散策略框架和轻量级的障碍物感知视觉编码器,使得机器人能够在复杂环境中有效地进行运动生成,与传统方法相比,显著提升了泛化能力。
关键设计:在设计中,采用了特定的损失函数来优化目标对齐策略,并通过调整网络结构来提高障碍物感知的准确性,确保生成的轨迹能够有效避开障碍物。
🖼️ 关键图片
📊 实验亮点
在实验中,ObstaDiff在61个真实机器人温室试验中取得了75.41%的平均任务成功率和8.20%的平均障碍物碰撞率,显著优于传统模仿学习基线,展现了其在杂乱环境中的优越性能。
🎯 应用场景
该研究的潜在应用领域包括农业机器人、服务机器人和工业自动化等场景。通过提高机器人在复杂环境中的操作能力,ObstaDiff能够显著提升机器人在实际应用中的效率和安全性,具有重要的实际价值和未来影响。
📄 摘要(原文)
Imitation learning has achieved impressive results in robotic manipulation, yet most existing approaches assume clean backgrounds and lack explicit mechanisms for obstacle-aware motion generation. Extending such policies to cluttered, real-world scenes with unstructured obstacles remains a key generalization challenge. We present ObstaDiff, a decomposed diffusion-policy framework with a lightweight obstacle-aware visual encoder. ObstaDiff extracts a structured target-obstacle-background representation, enabling the downstream alignment policy to generate end-effector trajectories toward a target-centered bottleneck pose while reasoning about surrounding obstacles. We evaluate ObstaDiff on 61 real-robot greenhouse trials per method (366 executions in total). ObstaDiff achieves 75.41% average task success and 8.20% average obstacle collision rate, outperforming representative imitation-learning baselines and improving generalization in cluttered agricultural scenes.