CLAP: Direct VLM-to-VLA Adaptation via Language-Action Grounding
作者: Yuri Ishitoya, Jeremy Siburian, Masashi Hamaya, Kuniaki Saito, Cristian C. Beltran-Hernandez, Mai Nishimura
分类: cs.RO, cs.AI
发布日期: 2026-07-09
备注: Project website: https://omron-sinicx.github.io/clap/
💡 一句话要点
提出CLAP以解决VLM与VLA适配问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 视觉-语言-动作模型 预训练模型 因果预测 机器人控制 多模态学习
📋 核心要点
- 现有方法在将预训练的VLM转化为VLA时,面临输出分布不匹配的问题,导致性能下降。
- CLAP通过在动作序列前添加自然语言描述,因果地条件化动作预测,避免了对模型架构的修改。
- 实验结果表明,CLAP在LIBERO数据集上达到了90.8%的准确率,显著提升了模型的鲁棒性。
📝 摘要(中文)
视觉-语言-动作模型(VLA)从预训练的视觉-语言模型(VLM)中继承了语义能力,但在机器人数据上的大规模后训练和架构修改可能会导致难以隔离VLM对控制的贡献。直接将预训练的VLM转换为VLA,且最小化架构变化,可以更透明地理解VLM能力如何在模型规模间转移。本文提出CLAP(因果语言-动作预测),通过在每个数字动作序列前添加自然语言动作描述,解决了输出分布不匹配的问题。CLAP在单次训练中,2B模型在LIBERO数据集上达到了90.8%的准确率,相较于VLA-0提升了14.9个百分点,并在LIBERO-PRO上提高了对语言、物体和空间扰动的鲁棒性。
🔬 方法详解
问题定义:本文旨在解决预训练的视觉-语言模型(VLM)在转化为视觉-语言-动作模型(VLA)时,因输出分布不匹配而导致的性能下降问题。现有方法在大规模后训练和架构修改后,难以明确VLM对控制的贡献。
核心思路:CLAP的核心思路是通过在每个数字动作序列前添加自然语言动作描述,来因果地条件化动作预测。这种设计使得动作生成更贴近VLM的预训练语言分布,从而保留其能力。
技术框架:CLAP的整体架构包括两个主要模块:自然语言描述生成模块和动作预测模块。前者负责生成与动作序列对应的自然语言描述,后者则基于这些描述进行精确的动作预测。
关键创新:CLAP的关键创新在于通过自然语言描述来解决输出分布不匹配问题,而不是对模型架构进行复杂的修改。这一方法使得VLM的能力能够更有效地转移到VLA。
关键设计:在模型设计中,CLAP采用了单次训练的策略,使用了特定的损失函数来优化语言描述与动作序列之间的匹配。此外,模型的参数设置经过精心调整,以确保在不同规模下的有效性。
🖼️ 关键图片
📊 实验亮点
CLAP在LIBERO数据集上达到了90.8%的准确率,相较于基线VLA-0提升了14.9个百分点。此外,CLAP在LIBERO-PRO数据集上表现出更强的鲁棒性,能够有效应对语言、物体和空间的扰动,显示出其在实际应用中的潜力。
🎯 应用场景
CLAP的研究成果在机器人控制、自动化任务执行和人机交互等领域具有广泛的应用潜力。通过提高VLM到VLA的适配效率,CLAP可以帮助开发更智能的机器人系统,使其在复杂环境中更好地理解和执行任务。未来,CLAP的多尺度模型也将为相关领域的研究提供新的思路和工具。
📄 摘要(原文)
Vision-language-action models (VLAs) inherit semantic capabilities from pretrained VLMs, yet large-scale post-training on robot data and architectural modifications can reshape the backbone so extensively that it becomes difficult to isolate what the VLM contributes to control. Directly converting pretrained VLMs into VLAs with minimal architectural change offers a more transparent path to understanding how VLM capabilities transfer across model scales. The core obstacle is output-distribution mismatch: predicting actions as bare numeric token sequences moves generation away from the VLM's pretrained language distribution, degrading the capabilities we seek to preserve. To address this, we propose CLAP (Causal Language-Action Prediction), which prepends each numeric action sequence with a natural-language action description, causally conditioning precise action-token prediction on a language-action plan without modifying the backbone architecture. With single-epoch fine-tuning alone, 2B CLAP achieves 90.8% on LIBERO (+14.9 pt over VLA-0) and improves robustness on LIBERO-PRO under language, object, and spatial perturbations. We will release CLAP at 0.8B, 2B, and 4B as an open-weight, multi-scale compact VLA family from a single VLM lineage, enabling controlled analysis of VLM-to-VLA capability transfer.