FabriVLA: A Lightweight Vision-Language-Action Model for Precise Multi-Task Manipulation

📄 arXiv: 2607.08575v2 📥 PDF

作者: Shiyuan Yang, Borong Zhang, Jizheng Zhang, Zhijia Tao, Junfei Guo, Donglai Ran, Xu Bian, Qingbiao Li

分类: cs.RO

发布日期: 2026-07-09 (更新: 2026-07-10)


💡 一句话要点

提出FabriVLA以解决多任务精确操控问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉-语言-动作 多任务操控 轻量级模型 门控自注意力 机器人技术

📋 核心要点

  1. 现有的视觉-语言-动作模型往往依赖于庞大的参数规模,导致计算资源消耗高,难以在多任务操控中实现高效性能。
  2. FabriVLA通过结合轻量级的视觉-语言主干与流匹配动作头,采用门控自注意力机制,旨在提高多任务操控的精确性与效率。
  3. 在Meta-World MT50基准测试中,FabriVLA实现了90.0%的成功率,展示了其在多任务操控中的优越性能和高效性。

📝 摘要(中文)

我们提出了FabriVLA,一个轻量级的视觉-语言-动作模型,用于精确的多任务操控。FabriVLA结合了InternVL3.5视觉-语言主干和流匹配动作头,采用跨动作标记的门控自注意力机制以及浅层VLM层融合,以丰富空间上下文。该模型通过从预训练的VLM和随机初始化的动作头进行单阶段联合优化进行训练。在涵盖50种多样化操控任务的Meta-World MT50基准上,FabriVLA达到了90.0%的平均成功率,证明了基于10亿参数规模的紧凑型VLA能够在不依赖数十亿参数的VLA主干的情况下实现强劲性能。

🔬 方法详解

问题定义:本论文旨在解决现有视觉-语言-动作模型在多任务操控中对计算资源的高需求和性能不足的问题。现有方法通常依赖于数十亿参数的模型,限制了其在实际应用中的可行性和灵活性。

核心思路:FabriVLA的核心思路是通过构建一个轻量级的模型,结合视觉-语言主干和流匹配动作头,以实现高效的多任务操控。采用门控自注意力机制来增强动作标记之间的关联性,从而提升模型的表现。

技术框架:FabriVLA的整体架构包括一个InternVL3.5视觉-语言主干和一个流匹配的动作头。模型通过单阶段联合优化进行训练,利用预训练的视觉-语言模型和随机初始化的动作头。

关键创新:FabriVLA的主要创新在于其轻量级设计和高效的门控自注意力机制,使得模型在保持较小参数规模的同时,仍能实现高达90.0%的成功率,显著优于传统的庞大模型。

关键设计:在模型设计中,采用了浅层VLM层融合技术,以丰富空间上下文信息。此外,流匹配动作头的设计使得模型能够更好地处理多任务操控中的复杂动作序列。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

FabriVLA在Meta-World MT50基准测试中实现了90.0%的平均成功率,展示了其在多任务操控中的卓越性能。与传统的数十亿参数模型相比,FabriVLA以仅1亿参数的规模实现了显著的性能提升,证明了其高效性和实用性。

🎯 应用场景

FabriVLA的研究成果在机器人操控、智能家居和自动化生产等领域具有广泛的应用潜力。其轻量级设计使得模型能够在资源受限的环境中高效运行,推动多任务操控技术的实际应用和发展。

📄 摘要(原文)

We present FabriVLA, a lightweight Vision-Language-Action model for Precise Multi-Task Manipulation. FabriVLA combines an InternVL3.5 vision-language backbone with a flow-matching action head featuring gated self-attention across action tokens and shallow VLM layer fusion for enriched spatial context. The model is trained via single stage joint optimization from a pretrained VLM and randomly initialized action head. On the Meta-World MT50 benchmark spanning 50 diverse manipulation tasks, FabriVLA achieves a tier-average success rate of 90.0%, demonstrating that a compact VLA built on a 1B scale VLM can achieve strong performance without relying on multi billion parameter VLA backbones.