Show-Harness: Just a VLM Agent Can Play Robots
作者: Yanzhe Chen, Zechen Bai, Zhijun Cao, Wenzheng Zeng, Kevin Qinghong Lin, Yiqi Lin, Guoqiang Liang, Kevin Yuchen Ma, Qiming Huang, Mike Zheng Shou
分类: cs.RO, cs.AI, cs.CV, cs.MM
发布日期: 2026-09-09
备注: Project website: https://showlab.github.io/Show-Harness
💡 一句话要点
提出Show-Harness以实现视觉语言模型的机器人控制
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱七:动作重定向 (Motion Retargeting) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 视觉语言模型 机器人控制 语义接口 具身化 人机交互 自动化 图形用户界面
📋 核心要点
- 现有的视觉语言模型在机器人控制方面的应用面临挑战,尤其是在将智能转化为具体动作时。
- Show-Harness通过提供一个紧凑的语义接口,使得VLM能够直接与机器人进行交互,简化了意图与动作之间的映射。
- 实验结果显示,使用Show-Harness的VLM代理在多种任务和环境中表现优异,超越了传统的代理和VLA方法。
📝 摘要(中文)
基础视觉语言模型(VLMs)展现出广泛的世界智能,但将这种智能转化为机器人控制仍然具有挑战性。我们提出了Show-Harness,这是一种具身化的接口,能够通过紧凑的语义接口将意图与动作连接,使VLM能够“玩”机器人。Show-Harness暴露出离散的语义动作单元,VLM可以自然推理,同时具身特定的解释器将其确定性地映射为本地机器人动作,使VLM直接负责细粒度的物理决策。通过相同的接口,Show-Harness展示了(1)直接解锁封闭源前沿VLM进行零-shot机器人控制的可行性,以及(2)仅需少量GPU小时的微调即可适应小规模开源VLM进行低成本部署。我们进一步开发了GUMI(图形用户界面操作接口),扩展了相同的语义动作空间以进行基于GUI的演示收集,允许人类和代理在不同具身化之间“玩”机器人,而无需专门的遥控硬件。大量实验表明,配备Show-Harness的VLM代理在任务、具身化和环境中具有良好的泛化能力,超越了代表性的代理和VLA范式。这些结果表明,合适的接口可以从基础VLM中释放出实质性的具身能力,而无需额外的模型容量或昂贵的具身特定预训练。
🔬 方法详解
问题定义:本论文旨在解决如何将视觉语言模型的智能有效转化为机器人控制的问题。现有方法在这一转化过程中存在复杂性和不确定性,限制了VLM的实际应用。
核心思路:论文提出的Show-Harness通过一个紧凑的语义接口,将VLM的意图与机器人动作直接连接,使得VLM能够自然推理并做出物理决策。这样的设计旨在简化机器人控制的复杂性,同时保留VLM的智能能力。
技术框架:Show-Harness的整体架构包括语义动作单元的定义、具身特定解释器的设计,以及与GUI操作接口(GUMI)的集成。该框架允许VLM在不同的具身化之间进行有效的交互。
关键创新:Show-Harness的主要创新在于其提供的语义接口,使得VLM能够在不需要额外模型容量的情况下,直接进行机器人控制。这与现有方法的本质区别在于,后者通常依赖于复杂的预训练和特定的硬件支持。
关键设计:在技术细节上,Show-Harness定义了离散的语义动作单元,并设计了具身特定的解释器来将这些动作映射为具体的机器人行为。此外,GUMI接口的设计使得人类和代理能够在不同的具身化之间进行无缝交互。实验中使用的损失函数和参数设置经过精心调整,以确保模型的高效性和准确性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,配备Show-Harness的VLM代理在多种任务中表现出色,尤其是在零-shot机器人控制方面,超越了传统的代理和VLA方法,展示了显著的性能提升,具体表现为在不同环境和具身化下的高泛化能力。
🎯 应用场景
该研究的潜在应用领域包括智能机器人、自动化操作和人机交互等。通过简化机器人控制的复杂性,Show-Harness可以在多个行业中实现低成本、高效率的机器人应用,推动智能自动化的发展。未来,该技术有望在家庭服务、工业自动化和医疗辅助等领域发挥重要作用。
📄 摘要(原文)
Foundation vision-language models (VLMs) exhibit broad intelligence about the world, yet translating this intelligence into robot control remains challenging. We present Show-Harness, an Embodied Harness that enables VLMs to "play" robots through a compact semantic interface linking intent to action. Show-Harness exposes discrete semantic action units that VLMs can naturally reason over, while embodiment-specific interpreters deterministically ground them into local robot actions, keeping the VLM directly responsible for fine-grained physical decisions. Through the same interface, Show-Harness demonstrates the feasibility of (1) directly unlocking closed-source frontier VLMs for zero-shot robot control, and (2) adapting small-scale open-source VLMs for low-cost deployment with just a few GPU-hours of fine-tuning. We further develop GUMI (GUI Manipulation Interface), which extends the same semantic action space to GUI-based demonstration collection, allowing humans and agents to "play" robots across embodiments without specialized teleoperation hardware. Extensive experiments show that Show-Harness-equipped VLM agents generalize robustly across tasks, embodiments, and environments, outperforming representative agentic and VLA paradigms. These results suggest that the right interface can unlock substantial embodied capability from foundation VLMs, without requiring additional model capacity or costly embodiment-specific pretraining.