A Minimalist Retargeting-Guided Reinforcement Learning Recipe for Dexterous Manipulation
作者: Yunhai Feng, Natalie Leung, Jiaxuan Wang, Lujie Yang, Haozhi Qi, Preston Culbertson
分类: cs.RO, cs.AI, cs.LG
发布日期: 2026-07-13
备注: Website: https://yunhaifeng.com/REGRIND
💡 一句话要点
提出REGRIND以解决灵巧操作中的运动重定向问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture) 支柱七:动作重定向 (Motion Retargeting) 支柱八:物理动画 (Physics-based Animation)
关键词: 灵巧操作 强化学习 运动重定向 机器人控制 人机协作
📋 核心要点
- 现有方法在灵巧操作中面临复杂的接触动态和力的精细调节挑战,难以实现有效的策略迁移。
- REGRIND通过将人类手部运动重定向到机器人参考,训练强化学习策略以跟踪物体中心关键点,简化了学习过程。
- 实验结果显示,REGRIND在多指手的工具使用任务中实现了流畅的人类行为,验证了其有效性和实用性。
📝 摘要(中文)
近年来,类人全身控制在将人类运动重定向到机器人运动学参考方面取得了成功,但如何将这一方法转移到灵巧操作中并不明显。本文提出了REGRIND,一个极简的重定向引导强化学习管道,从单一的人类示范中学习灵巧操作策略。REGRIND将人类手部与物体的运动重定向到保留手部与物体空间和接触关系的机器人参考上,并在仿真中训练残差强化学习策略以跟踪该参考的物体中心关键点,最终实现零-shot转移到硬件上。实验结果表明,该策略在多指手的接触丰富工具使用任务中表现出流畅的人类行为。
🔬 方法详解
问题定义:本文旨在解决灵巧操作中运动重定向的挑战,现有方法在复杂的接触动态和力调节方面存在不足,导致策略迁移困难。
核心思路:REGRIND通过重定向人类手部与物体的运动,保留空间和接触关系,从而训练出有效的灵巧操作策略,简化了学习过程。
技术框架:REGRIND的整体架构包括三个主要模块:首先是人类示范的重定向,其次是在仿真中训练的残差强化学习策略,最后是将训练好的策略零-shot转移到硬件上。
关键创新:REGRIND的创新在于其极简的重定向引导策略,能够有效地从单一示范中学习,并在复杂的接触任务中实现流畅的人类行为,与现有方法相比具有显著的简化和效率提升。
关键设计:在设计中,REGRIND采用了特定的损失函数来优化物体中心关键点的跟踪,同时在系统识别阶段进行了细致的参数设置,以确保策略在硬件上的有效转移。
🖼️ 关键图片
📊 实验亮点
实验结果表明,REGRIND在多指手的工具使用任务中实现了流畅的人类行为,尤其是在使用剪刀和螺丝刀的任务中,表现出显著的灵巧性和适应性,验证了其在接触丰富环境中的有效性。
🎯 应用场景
该研究具有广泛的应用潜力,尤其是在机器人灵巧操作、自动化工具使用和人机协作等领域。REGRIND的有效性为未来的机器人学习和控制提供了新的思路,可能推动智能机器人在复杂环境中的应用。
📄 摘要(原文)
Recent work in humanoid whole-body control has found success with a simple recipe: retarget human motion to robot kinematic references, then train policies via reinforcement learning (RL) to track them. But how does this recipe transfer to dexterous manipulation? The answer is not obvious, as manipulation involves complex, contact-rich dynamics and requires delicate regulation of contact modes and forces. We present REGRIND, a minimalist retargeting-guided RL pipeline that learns dexterous manipulation policies from a single human demonstration. REGRIND retargets human hand-object motion to a robot reference that preserves hand-object spatial and contact relationships, trains a residual RL policy in simulation to track object-centric keypoints along that reference, and transfers the resulting policy zero-shot to hardware with careful system identification. The resulting policies produce fluid, human-like behavior on two different multi-fingered hands across contact-rich tool-use tasks, including operating a pair of scissors and turning a screwdriver. Through systematic hardware experiments, we identify and analyze the key factors that govern sim-to-real transfer in dexterous manipulation, offering practical guidance for retargeting-based learning in contact-rich settings. Videos and code are available at https://yunhaifeng.com/REGRIND.