Extreme-RGMT: Continual Learning of Highly Dynamic Skills for Robust Generalist Humanoid Control
作者: Yubiao Ma, Han Yu, Kai Guo, Changtai Lv, Zhengquan Mao, Boyang Xing, Xuemei Ren, Dongdong Zheng
分类: cs.RO
发布日期: 2026-07-22
💡 一句话要点
提出Extreme-RGMT以解决人形机器人动态技能学习问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱八:物理动画 (Physics-based Animation)
关键词: 人形机器人 动态技能学习 持续学习 运动跟踪 强化学习
📋 核心要点
- 现有的人形机器人控制方法在通用性与专业性之间存在权衡,难以同时实现高效的动态技能学习与稳定的日常行为执行。
- Extreme-RGMT通过两阶段的持续学习框架,首先学习通用运动策略,然后采用不对称技能获取机制,强调困难动态片段的学习。
- 实验结果显示,Extreme-RGMT在全身运动跟踪性能上达到了最先进水平,尤其是在执行高度动态动作方面有显著提升。
📝 摘要(中文)
人类能够逐步掌握高度动态的运动技能,同时保持可靠的日常运动能力。现有的人形控制器在通用性与专业性之间存在权衡:通用运动跟踪策略难以可靠执行稀有的高度动态动作,而专业训练则可能导致之前掌握的行为退化。为此,本文提出Extreme-RGMT,一个用于稳健通用人形控制的两阶段持续学习框架。该方法首先从多源运动数据中学习通用运动跟踪基础策略,然后采用不对称的技能获取和能力巩固机制,以约束已掌握动作的策略漂移,同时强调困难的动态片段。实验表明,Extreme-RGMT在通用全身运动跟踪性能上达到了最先进水平,显著提高了对挑战性高度动态动作的完成能力。
🔬 方法详解
问题定义:现有的人形机器人控制方法在通用性与专业性之间存在权衡,通用策略难以执行稀有的高度动态动作,而专业训练可能导致已掌握行为的退化。
核心思路:Extreme-RGMT通过两阶段的持续学习框架,首先从多源运动数据中学习通用运动跟踪策略,然后采用不对称的技能获取和能力巩固机制,约束策略漂移并强调困难动态片段的学习。
技术框架:该方法分为两个主要阶段:第一阶段是从多样化的运动数据中学习通用基础策略,第二阶段则结合困难感知采样与优势优先的轨迹重采样,强调关键动态片段的学习。
关键创新:最重要的技术创新在于不对称的技能获取与能力巩固机制,能够有效地约束已掌握动作的策略漂移,同时提升对高度动态动作的学习能力,这与现有方法的单一训练策略形成了显著区别。
关键设计:在参数设置上,采用了困难感知采样策略,以确保在训练过程中更关注高失败率的动态动作;损失函数设计上,结合了策略漂移约束与动态片段的强化学习目标,以实现更好的学习效果。
🖼️ 关键图片
📊 实验亮点
实验结果表明,Extreme-RGMT在通用全身运动跟踪性能上达到了最先进水平,特别是在高度动态动作的完成率上提升了显著,具体性能数据未提供,但相较于基线方法有明显的改进。
🎯 应用场景
该研究的潜在应用领域包括人形机器人、自动化控制系统以及虚拟现实等场景。通过提升机器人在高度动态环境中的运动能力,能够实现更复杂的任务执行,如人机协作、救援行动等,具有重要的实际价值和未来影响。
📄 摘要(原文)
Humans can progressively acquire highly dynamic motor skills while preserving reliable everyday motor abilities. In contrast, existing humanoid controllers face a trade-off between generalist and specialist capabilities: generalist motion tracking policies struggle to reliably execute rare highly dynamic motions, whereas specialist training can degrade previously acquired behaviors. We introduce Extreme-RGMT, a two-stage continual learning framework for robust generalist humanoid control. The method first learns a generalist motion-tracking base policy from diverse multi-source motion data, then employs an asymmetric skill acquisition and capability consolidation mechanism to constrain policy drift on mastered motions while emphasizing difficult dynamic segments. To address the scarcity of highly dynamic motions, their high failure rates, and the resulting shortage of informative samples, Extreme-RGMT combines difficulty-aware sampling with advantage-prioritized trajectory resampling to emphasize critical segments. Experiments show that Extreme-RGMT achieves state-of-the-art generalist whole-body motion-tracking performance, including substantially improved completion of challenging highly dynamic motions. The resulting controller directly executes diverse unseen highly dynamic motions under fixed references and online inertial motion-capture inputs, advancing generalist whole-body motion-tracking controllers toward highly dynamic motor capabilities at the human-expert level.