Calf-Integrated Arms for Bimanual Quadruped Loco-Manipulation

📄 arXiv: 2607.06186v1 📥 PDF

作者: Yan Pan, Yuanchuan Ren, Chipui Chan, Jingcheng Sun, Chengxu Zhou

分类: cs.RO

发布日期: 2026-07-07

备注: 6 pages, 6 figures


💡 一句话要点

提出小腿集成臂以解决四足机器人双手操控问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control)

关键词: 四足机器人 双手操控 操控器集成 视觉-语言模型 自主任务选择

📋 核心要点

  1. 现有四足机器人设计在操控能力与稳定性之间存在矛盾,限制了其应用场景。
  2. 本文提出将操控器集成到前小腿中,使机器人在不抬起腿部的情况下进行双手操控。
  3. 仿真实验表明,该设计能够有效完成多种双手任务,提升了机器人的自主性和灵活性。

📝 摘要(中文)

大多数四足机器人在运动能力与操控能力之间存在权衡。传统设计中,臂部通常安装在躯干上,且通常只配备单臂;使用腿部作为操控器时,需将操控腿抬离地面;即便是腿部安装的抓手,也只能通过后腿站立来完成双手任务。本文将一个集成了伸缩滑块、两个旋转关节和一个抓手的操控器整合到Unitree Go2的每个前小腿中。该设计使得两只手可以在地面上抓取物体并进行双手操控,同时四只脚保持接触地面,无需站立。通过一只手携带物体,机器人可以自由行走。使用视觉-语言模型在每个技能边界上从预定义库中选择技能,基于头部摄像头图像和任务状态,实现长时间的自主操作。仿真中,该设计完成了三个双手任务:自主技能选择下的长时间柜子任务、合作双手提升和臂间物体交接。

🔬 方法详解

问题定义:本文旨在解决四足机器人在执行双手操控任务时的稳定性与操控能力之间的矛盾。现有方法往往需要抬起腿部或使用单臂,限制了机器人的操作灵活性和效率。

核心思路:通过将操控器集成到前小腿中,机器人可以在保持四足稳定的同时进行双手操控,避免了传统设计中的局限性。这样的设计使得机器人能够在地面上进行多种操作,而不需要改变其站立姿态。

技术框架:整体架构包括前小腿集成的操控器、视觉-语言模型和任务状态监测模块。操控器由伸缩滑块、旋转关节和抓手组成,视觉-语言模型用于根据环境和任务状态选择合适的操控技能。

关键创新:最重要的创新在于将操控器直接集成到小腿中,使得机器人在执行双手任务时无需抬起腿部,保持了稳定的站立姿态。这一设计与传统的臂部设计形成了鲜明对比。

关键设计:在设计中,操控器的关节配置和抓手设计经过优化,以确保在执行双手任务时的灵活性和稳定性。视觉-语言模型的训练数据集也经过精心选择,以提高任务选择的准确性和效率。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,该设计在三个双手任务中表现出色,包括长时间柜子任务的自主技能选择、合作双手提升和臂间物体交接。与传统方法相比,机器人在执行这些任务时的稳定性和灵活性显著提升,展示了更高的自主性。

🎯 应用场景

该研究的潜在应用领域包括服务机器人、救援机器人和工业自动化等场景。通过提升四足机器人的操控能力,可以在复杂环境中实现更高效的物体搬运和操作,具有重要的实际价值和广泛的应用前景。

📄 摘要(原文)

Most quadruped loco-manipulation designs trade manipulation capability against stance. A trunk-mounted arm sits high and usually carries a single arm; using the legs as manipulators lifts the manipulating leg off the ground; and even leg-mounted grippers reach two-handed tasks only by rearing onto the hind legs. This paper integrates a manipulator with a prismatic slider, two revolute joints, and a gripper into each front calf of a Unitree Go2. The two arms grasp objects at ground level and manipulate with both hands while all four feet stay planted, without rearing. With one arm carrying, the base stays free to walk. A vision-language model sequences skills from a predefined library at each skill boundary, conditioned on the head-camera image and task state, for long-horizon autonomy. In simulation, the design performs three bimanual tasks: a long-horizon cabinet task under autonomous skill selection, a cooperative two-handed lift, and an inter-arm handover.