FabriVLA: A Lightweight Vision-Language-Action Model for Precise Multi-Task Manipulation
作者: Shiyuan Yang, Borong Zhang, Jizheng Zhang, Zhijia Tao, Junfei Guo, Donglai Ran, Xu Bian, Qingbiao Li
分类: cs.RO
发布日期: 2026-07-09
💡 一句话要点
提出FabriVLA以解决多任务精确操作问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 视觉-语言-动作 多任务操作 轻量级模型 门控自注意力 机器人技术 智能家居 自动化制造
📋 核心要点
- 现有的视觉-语言-动作模型通常依赖于庞大的参数量,导致计算资源消耗高,难以在多任务操作中实现精确控制。
- FabriVLA通过结合轻量级的视觉-语言骨干和流匹配动作头,采用门控自注意力机制,优化了多任务操作的效率和精度。
- 在Meta-World MT50基准测试中,FabriVLA达到了90.0%的成功率,显示出其在多任务操作中的优越性能和高效性。
📝 摘要(中文)
我们提出了FabriVLA,一种轻量级的视觉-语言-动作模型,旨在实现精确的多任务操作。FabriVLA结合了InternVL3.5视觉-语言骨干网络与流匹配动作头,采用门控自注意力机制处理动作标记,并通过浅层VLM层融合增强空间上下文。该模型通过从预训练的VLM和随机初始化的动作头进行单阶段联合优化进行训练。在涵盖50种多样化操作任务的Meta-World MT50基准测试中,FabriVLA实现了90.0%的平均成功率,证明了基于10亿参数规模的紧凑型VLA能够在不依赖数十亿参数VLA骨干的情况下实现强劲性能。
🔬 方法详解
问题定义:本论文旨在解决现有视觉-语言-动作模型在多任务操作中面临的高计算资源消耗和精确控制能力不足的问题。现有方法通常依赖于数十亿参数的模型,限制了其在实际应用中的灵活性和效率。
核心思路:FabriVLA的核心思路是通过构建一个轻量级的视觉-语言-动作模型,结合高效的视觉-语言骨干和流匹配动作头,来实现多任务操作的精确控制。通过门控自注意力机制,模型能够更好地处理动作标记之间的关系,从而提高操作的准确性。
技术框架:FabriVLA的整体架构包括两个主要模块:首先是InternVL3.5视觉-语言骨干,负责提取视觉和语言特征;其次是流匹配动作头,利用门控自注意力机制对动作标记进行处理。模型通过单阶段联合优化进行训练,结合预训练的视觉-语言模型和随机初始化的动作头。
关键创新:FabriVLA的关键创新在于其轻量级设计和流匹配动作头的引入,使得模型在保持高性能的同时,显著降低了参数量。这一设计使得模型能够在不依赖庞大参数的情况下,依然实现了优异的多任务操作能力。
关键设计:在模型设计中,采用了门控自注意力机制来增强动作标记之间的关系处理能力,同时通过浅层VLM层融合来丰富空间上下文。此外,模型的训练采用了单阶段联合优化策略,以提高训练效率和效果。
🖼️ 关键图片
📊 实验亮点
在Meta-World MT50基准测试中,FabriVLA实现了90.0%的平均成功率,显著优于传统的数十亿参数模型。这一结果表明,轻量级的VLA模型能够在多任务操作中提供强大的性能,提升了操作的效率和准确性。
🎯 应用场景
FabriVLA的研究成果在机器人操作、智能家居、自动化制造等领域具有广泛的应用潜力。其轻量级设计使得模型能够在资源受限的环境中高效运行,推动多任务操作技术的实际应用和发展。未来,FabriVLA有望在更复杂的操作场景中展现出更强的适应性和灵活性。
📄 摘要(原文)
We present FabriVLA, a lightweight Vision-Language-Action model for Precise Multi-Task Manipulation. FabriVLA combines an InternVL3.5 vision-language backbone with a flow-matching action head featuring gated self-attention across action tokens and shallow VLM layer fusion for enriched spatial context. The model is trained via single stage joint optimization from a pretrained VLM and randomly initialized action head. On the Meta-World MT50 benchmark spanning 50 diverse manipulation tasks, FabriVLA achieves a tier-average success rate of 90.0%, demonstrating that a compact VLA built on a 1B scale VLM can achieve strong performance without relying on multi billion parameter VLA backbones.