IMLE-VLA: Fast Single-Step Action Generation for Vision-Language-Action Policies
作者: Kian Hosseinkhani, Qinhe Peng, George Shramko, Mehran Aghabozorgi, Jianing Qian, Tristan Engst, Alireza Moazeni, Dinesh Jayaraman, Ke Li
分类: cs.RO, cs.CV
发布日期: 2026-09-10
备注: 8 pages, 5 figures, 5 tables. Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026. Project page: https://kianhk6.github.io/IMLE-VLA/
🔗 代码/项目: PROJECT_PAGE
💡 一句话要点
提出IMLE-VLA以解决视觉-语言-动作策略中的推理瓶颈问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 视觉-语言-动作 条件生成器 隐式最大似然估计 推理效率 机器人控制
📋 核心要点
- 现有视觉-语言-动作策略依赖于多步采样,导致推理速度慢和运动不流畅。
- IMLE-VLA通过引入单步条件生成器,利用条件隐式最大似然估计,避免了多步采样的需求。
- 在LIBERO基准测试中,IMLE-VLA的成功率达到98.0%,推理频率提高至55 Hz,显著提升了任务完成效率。
📝 摘要(中文)
视觉-语言-动作(VLA)策略利用预训练的视觉-语言骨干网络实现强大的跨任务泛化能力。现有方法通常依赖于多步采样的连续动作头,这导致推理瓶颈和机器人运动的停顿。本文提出IMLE-VLA,通过条件隐式最大似然估计(cIMLE)替代多步采样,使用单步条件生成器,从而提高推理频率和动作吞吐量。在40个任务的LIBERO基准测试中,IMLE-VLA实现了98.0%的最高平均成功率,并在推理频率上领先。实际实验表明,IMLE-VLA在多个任务中表现出更平滑的运动和更快的任务完成速度。
🔬 方法详解
问题定义:现有的视觉-语言-动作策略通常依赖于多步采样的连续动作头,这导致推理速度慢,机器人运动出现停顿,影响任务完成效率。
核心思路:本文提出IMLE-VLA,通过条件隐式最大似然估计(cIMLE)替代传统的多步采样方法,使用单步条件生成器,从而提高推理效率和动作的多样性。
技术框架:IMLE-VLA的整体架构包括一个预训练的视觉-语言骨干网络和一个单步条件生成器。该框架通过cIMLE目标进行训练,促进多模态动作覆盖。
关键创新:IMLE-VLA的核心创新在于引入了单步条件生成器,避免了传统方法中的模式崩溃问题,并消除了多步采样的需求,从而显著提高了推理频率和动作吞吐量。
关键设计:在设计中,IMLE-VLA使用了特定的损失函数来优化cIMLE目标,并通过调整网络结构来增强生成器的性能,确保在多任务环境中保持高效和鲁棒性。
🖼️ 关键图片
📊 实验亮点
IMLE-VLA在40个任务的LIBERO基准测试中实现了98.0%的最高平均成功率,并将推理频率提高至55 Hz,相较于传统方法提升了3.67倍。实际实验显示,IMLE-VLA在每个任务中都表现出更平滑的运动,平均推理时间减少了3.9倍至6.6倍,显著提升了任务完成速度。
🎯 应用场景
IMLE-VLA的研究成果可以广泛应用于机器人控制、自动化任务执行和人机交互等领域。其高效的推理能力和流畅的动作生成能够提升机器人在复杂环境中的适应性和执行效率,具有重要的实际价值和未来影响。
📄 摘要(原文)
Vision-language-action (VLA) policies leverage pretrained vision-language backbones to achieve strong cross-task generalization. A leading design couples this backbone with a dedicated continuous action head trained via diffusion or flow matching. However, such heads rely on iterative multi-step sampling, for example 10 Euler steps in $π_{0.5}$. This creates an inference bottleneck that produces stop-and-go movement in the robot and slower task completion. We introduce IMLE-VLA, which replaces the iterative action head with a single-step conditional generator trained via conditional Implicit Maximum Likelihood Estimation (cIMLE). The cIMLE objective promotes multimodal action coverage, avoiding the mode collapse of naive regression heads while eliminating multi-step sampling entirely. When IMLE-VLA is applied to $π_{0.5}$, it increases inference frequency 3.67x (55 Hz vs. 15 Hz), enabling up to 11x higher action throughput. On the 40-task LIBERO benchmark, IMLE-VLA achieves the highest average success rate (98.0%) among all baselines while leading in inference frequency. Under the test-time perturbations of LIBERO-plus, IMLE-VLA retains $π_{0.5}$'s robustness while other baselines degrade sharply, confirming that the cIMLE head preserves generalization. Real-world experiments on a Franka Emika Panda across four tasks demonstrate smoother motion (2.2x to 3.0x lower jerk) and faster task completion, with IMLE-VLA outperforming $π_{0.5}$ on every task and reducing average VLA inference time per episode by 3.9x to 6.6x. Videos and code are available at https://kianhk6.github.io/IMLE-VLA/