RhinoVLA Technical Report
作者: Huixi Technology, Chen Zhang, Chenyang Zhou, Guanglei Ding, Guanghui He, Haibin Gao, Jiajia Chen, Jianyong Zhang, Lianyi Yu, Ningyi Xu, Ping Xu, Qingchen Li, Yingjun Hu, Yijia Zhang, Yuxi Liu
分类: cs.RO, cs.LG
发布日期: 2026-07-20
💡 一句话要点
提出RhinoVLA以解决边缘硬件上VLA模型实时部署问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 视觉-语言-动作 边缘计算 机器人操作 实时推理 多模态学习
📋 核心要点
- 现有的视觉-语言-动作模型在边缘硬件上部署时存在显著的延迟,影响实时应用。
- RhinoVLA通过优化标记效率和计算负担,结合硬件特性,提升了模型在边缘设备上的实时性能。
- 实验结果显示,RhinoVLA在参数规模相似的情况下,推理速度达到11.69 Hz,性能与基线模型{C0}0.5相当。
📝 摘要(中文)
视觉-语言-动作(VLA)模型在机器人操作中展现出强大的潜力,但在边缘硬件上的实时部署仍然面临挑战。本文识别出VLA模型中的视觉和上下文标记是导致部署延迟的主要原因。为此,提出了RhinoVLA,一个与Huixi R1边缘SoC共同设计的面向部署的VLA模型。RhinoVLA采用高效的Qwen3-VL骨干网络和连续的动作专家,减少了VLA模型的标记和计算负担,同时保留了预训练的多模态能力。此外,RhinoVLA引入了统一接口,支持跨机器人学习。实验表明,RhinoVLA在Huixi R1上实现了11.69 Hz的端到端推理,满足10 Hz的实时闭环控制目标。
🔬 方法详解
问题定义:本文旨在解决视觉-语言-动作(VLA)模型在边缘硬件上实时部署的延迟问题。现有方法在处理视觉和上下文标记时,计算量随着输入标记数量的增加而线性增长,导致性能瓶颈。
核心思路:RhinoVLA通过采用高效的Qwen3-VL骨干网络和连续的动作专家,减少了VLA模型的标记和计算负担,从而提升了实时性能。该设计旨在在保持多模态能力的同时,优化计算效率。
技术框架:RhinoVLA的整体架构包括高效的视觉-语言模型、统一接口以及硬件优化模块。统一接口结合了视图注册、72D物理状态-动作槽空间和机器人实例LoRA,支持跨机器人学习。
关键创新:RhinoVLA的主要创新在于其硬件感知的编译和混合精度执行策略,显著降低了计算延迟,同时保持了模型的多模态能力。这一设计与传统VLA模型在计算效率上有本质区别。
关键设计:RhinoVLA在参数设置上进行了优化,采用了高效的损失函数和网络结构设计,以适应边缘硬件的计算限制。具体细节包括对标记数量的控制和并行视觉编码的实现。
🖼️ 关键图片
📊 实验亮点
RhinoVLA在Huixi R1上的实验结果显示,其端到端推理速度达到11.69 Hz,满足10 Hz的实时闭环控制目标,且在参数规模相似的情况下,性能与基线模型{C0}0.5相当,展现出显著的实时处理能力。
🎯 应用场景
RhinoVLA的研究成果在机器人操作、智能家居和工业自动化等领域具有广泛的应用潜力。通过优化边缘设备上的实时推理能力,该模型能够支持更复杂的机器人任务和人机交互场景,推动智能机器人技术的普及与发展。
📄 摘要(原文)
Vision-Language-Action (VLA) models have shown strong potential for robotic manipulation, but real-time deployment on edge hardware remains challenging. In this work, we identify VLM visual and context tokens as a major source of deployment latency: for GEMM-dominated projection operators, computation grows linearly with the number of input tokens when model dimensions are fixed. Motivated by this observation, we propose RhinoVLA, a deployment-oriented VLA model co-designed with the Huixi R1 edge SoC. RhinoVLA adopts a token-efficient Qwen3-VL backbone and a continuous Action Expert, reducing the VLM-side token and computation burden while preserving pretrained multimodal capability. To support cross-robot learning, RhinoVLA further introduces a unified interface that combines View Registry, 72D physical state-action slot space, and robotinstance LoRA, allowing heterogeneous robot observations and action schemas to be aligned under a shared policy. On the deployment side, RhinoVLA is optimized through hardware-aware compilation, mixed-precision execution, and parallel visual encoding. Experiments show that RhinoVLA achieves downstream performance comparable to {\pi}0.5 at a similar parameter scale, while reaching 11.69 Hz end-to-end inference on Huixi R1, meeting the 10 Hz real-time closedloop control target. The project will be open-sourced atthis https URL.