ViBe: Visual Behavior Adaptation for Perceptive Humanoid Whole-Body Control
作者: Lokesh Krishna, Sarvesh Venkatesan, An Zhang, Quan Nguyen
分类: cs.RO
发布日期: 2026-09-09
备注: project page: https://lok-i.github.io/vibe-control/
💡 一句话要点
提出ViBe框架以解决人形机器人感知控制问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture) 支柱八:物理动画 (Physics-based Animation)
关键词: 人形机器人 运动跟踪 感知控制 视觉编码器 后训练框架 策略优化 低秩适配器
📋 核心要点
- 现有的运动跟踪器缺乏外部感知反馈,导致机器人在动态环境中的反应能力不足。
- ViBe框架通过后训练方法,结合预训练视觉编码器和多查询提取模块,提升运动跟踪器的感知控制能力。
- 在四个不同任务中,ViBe实现了零样本的仿真到现实转移,表现出在复杂环境下的鲁棒性。
📝 摘要(中文)
运动跟踪为人形机器人全身控制提供了一种可扩展的方法。然而,现有的跟踪器缺乏外部感知反馈,导致环境反应依赖于高层规划器。现有的感知控制器通常从头开始训练几何编码器,牺牲了语义信息以实现从仿真到现实的简易性,并依赖教师-学生蒸馏。本文提出ViBe,一个后训练框架,用于将运动跟踪器适应于感知控制任务。我们利用预训练的视觉编码器和多查询提取模块学习任务相关的感知反馈,并通过低秩适配器将其 graft 到跟踪器输入上,实现参数高效的微调。ViBe在四个任务中展示了零样本的仿真到现实转移,表现出在户外、低光和RGB干扰条件下的视觉鲁棒性。
🔬 方法详解
问题定义:本文旨在解决现有运动跟踪器在感知控制任务中缺乏外部反馈的问题。现有方法通常依赖几何编码器,导致在复杂环境中的表现不佳。
核心思路:ViBe框架通过后训练的方法,利用预训练的视觉编码器和多查询提取模块,学习与任务相关的感知反馈,从而增强运动跟踪器的环境适应能力。
技术框架:ViBe的整体架构包括三个主要模块:预训练视觉编码器、多查询提取模块和低秩适配器。预训练编码器负责提取视觉特征,多查询提取模块则从中提取任务相关的反馈,最后通过低秩适配器将反馈融入跟踪器输入中。
关键创新:ViBe的创新之处在于其后训练框架,能够在不重新训练整个模型的情况下,利用已有的视觉编码器进行高效的参数微调。这种方法显著提高了感知控制的效率和效果。
关键设计:在设计中,低秩适配器用于有效地将感知反馈集成到跟踪器中,确保了参数的高效利用。此外,采用了基于任务奖励和参考数据集的策略优化方法,进一步提升了控制性能。
🖼️ 关键图片
📊 实验亮点
在四个任务中,ViBe实现了零样本的仿真到现实转移,表现出在户外、低光和RGB干扰条件下的视觉鲁棒性。具体而言,ViBe在感知行走、Repose Cube、全方位物体操控和躲避球任务中均展现了优异的性能,验证了其在复杂环境中的有效性。
🎯 应用场景
ViBe框架在机器人控制领域具有广泛的应用潜力,尤其是在动态和复杂环境中的人形机器人操作。其能够有效地适应不同的感知任务,提升机器人在实际应用中的灵活性和智能化水平。未来,ViBe可能在服务机器人、救援机器人等领域发挥重要作用。
📄 摘要(原文)
Motion tracking provides a scalable recipe for humanoid whole-body control. By design, the resulting trackers lack exteroceptive feedback hence reacting to the environment remains the responsibility of a higher-level planner. Existing perceptive controllers train geometry-only encoders from scratch, trading semantics for sim-to-real ease, and typically rely on teacher-student distillation for a task of interest. We present ViBe, a post-training framework for adapting motion trackers to perceptive control tasks. We leverage pre-trained visual encoders with a multi-query extractor module to learn task-relevant perceptive feedback. This feedback is grafted onto the tracker's input via low-rank adapters, enabling parameter-efficient fine-tuning. Given a task reward and a reference dataset, this modular controller can be adapted directly via policy optimization. Across four tasks, ViBe shows zero-shot sim-to-real transfer spanning perceptive walking on curbs and parkour, Repose Cube, omni-object loco-manipulation, and dodgeball, with visually robust performance across outdoor, low-light, and RGB distractor conditions. Finally, we solve a goal-oriented Repose Cube task with a deliberately simple planner, demonstrating the efficacy of perceptive controllers, adapted by our approach.