EmbodiedDiffusion: End-to-End Traversability-Guided Visual Diffusion for Heterogeneous Robot Navigation
作者: Iana Zhura, Sausar Karaf, Faryal Batool, Nipun Dhananjaya Weerakkodi Mudalige, Valerii Serpiva, Ali Alridha Abdulkarim, Aleksey Fedoseev, Didar Seyidov, Hajira Amjad, Dzmitry Tsetserukou
分类: cs.RO
发布日期: 2026-07-20
💡 一句话要点
提出EmbodiedDiffusion以解决异构机器人导航中的可 traversability 估计问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 视觉可 traversability 估计 扩散模型 轨迹生成 机器人导航 合成监督 跨平台适应 实时推理
📋 核心要点
- 现有方法多依赖提示驱动的视觉语言模型或将可 traversability 与轨迹规划解耦,导致效率低下。
- 提出EmbodiedDiffusion框架,通过合成监督和体现条件实现可 traversability 预测与轨迹生成的统一。
- 在室内环境中,EmbodiedDiffusion实现了80-100%的导航成功率,且适应新平台仅需10分钟数据收集。
📝 摘要(中文)
视觉可 traversability 估计是自主导航的核心,但大多数方法依赖于提示驱动的视觉语言模型(VLM)或将可 traversability 与轨迹规划解耦,需单独规划器,导致重映射、手动调优和延长部署时间。我们提出了EmbodiedDiffusion,这是一种基于扩散的框架,能够同时从RGB图像预测可 traversability 图和生成可行轨迹,采用无规划器的合成监督和体现条件以实现跨平台转移。该框架在训练过程中从VLM教师中提炼类别级可 traversability 语义到轻量级学生模型,实现了无提示、实时推理。通过模块化的FiLM基础条件机制,将体现特定推理隔离到网络的紧凑可训练子集,使其能够快速适应新机器人平台而无需重新训练视觉主干或轨迹扩散模型。在四足和空中机器人室内环境中,EmbodiedDiffusion在全数据模式下实现了80-100%的导航成功率,实时推理时间为90毫秒,并仅需10分钟的视觉数据收集即可适应新平台,展示了可扩展的统一可 traversability 推理和轨迹生成能力。
🔬 方法详解
问题定义:本论文旨在解决异构机器人导航中的可 traversability 估计问题。现有方法通常依赖于复杂的提示驱动模型或将可 traversability 与轨迹规划分开,导致效率低下和部署时间延长。
核心思路:EmbodiedDiffusion框架通过结合扩散模型和合成监督,实现了可 traversability 预测与轨迹生成的无缝集成,避免了对复杂规划器的依赖。
技术框架:该框架包括两个主要模块:可 traversability 预测模块和轨迹生成模块。前者从RGB图像中提取可 traversability 信息,后者生成可行的导航轨迹。
关键创新:最重要的创新在于通过FiLM基础条件机制将体现特定推理隔离到网络的可训练子集,使得模型能够快速适应不同的机器人平台,而无需重新训练整个网络。
关键设计:在训练过程中,采用轻量级学生模型从VLM教师中提炼可 traversability 语义,损失函数设计为优化轨迹生成的准确性和可 traversability 预测的精度,确保实时推理性能。
🖼️ 关键图片
📊 实验亮点
EmbodiedDiffusion在室内环境中实现了80-100%的导航成功率,推理时间为90毫秒,且在适应新平台时仅需10分钟的视觉数据收集,展示了其在效率和适应性方面的显著优势。
🎯 应用场景
该研究的潜在应用领域包括自主机器人导航、智能物流、无人机飞行等。通过实现高效的可 traversability 估计与轨迹生成,EmbodiedDiffusion能够显著提升异构机器人在复杂环境中的自主决策能力,推动智能机器人技术的发展。
📄 摘要(原文)
Visual traversability estimation is central to autonomous navigation, yet most approaches either rely on prompt-driven Vision-Language Model (VLM) or decouple traversability from trajectory planning, requiring separate planners with heavy mapping, manual tuning, and extended deployment time. We propose EmbodiedDiffusion, a diffusion-based framework that simultaneously predicts traversability maps and generates feasible trajectories from RGB images using planner-free synthetic supervision and embodiment conditioning for cross-platform transfer. The framework distills category-level traversability semantics from a VLM teacher into a lightweight student model during training, enabling prompt-free, real-time inference at deployment. A modular FiLM-based conditioning mechanism isolates embodiment-specific reasoning into a compact trainable subset of the network, allowing rapid adaptation to new robot platforms without retraining the visual backbone or the trajectory diffusion model. Across indoor environments with quadruped and aerial robots, EmbodiedDiffusion achieves 80-100% navigation success in the full-data regime with real-time inference (90 ms) and adapts to new platforms using only 10 min of visual data collection, demonstrating scalable, unified traversability reasoning and trajectory generation for heterogeneous robots.