AgenticFocus: Object-Preserving Mixed Reality Synthesis from Human FPV Video for Dexterous Humanoid Learning
作者: Iaroslav Kolomiets, Miguel Altamirano Cabrera, Artem Lykov, Jeffrin Sam, Dmitrii Iarchuk, Yara Mahmoud, Daniia Zinniatullina, Mikhail Konenkov, Dzmitry Tsetserukou
分类: cs.RO
发布日期: 2026-07-09
💡 一句话要点
提出AgenticFocus以解决人类视频中的物体遮挡问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture) 支柱六:视频提取与匹配 (Video Extraction) 支柱七:动作重定向 (Motion Retargeting)
关键词: 混合现实 类人政策学习 物体几何恢复 手部运动重建 机器人训练
📋 核心要点
- 现有方法在处理人类视频中的手部与物体遮挡时表现不佳,导致运动简化和对专用硬件的依赖。
- AgenticFocus通过恢复遮挡物体的几何形状和重建手部运动,利用混合现实技术将人类视频转化为机器人可训练的演示。
- 实验结果显示,AgenticFocus在轨迹误差和手腕运动平滑性方面优于现有的跨形态基线,取得了显著的性能提升。
📝 摘要(中文)
人类第一人称视角视频是用于类人政策学习的可扩展监督源,但现有方法在手部与物体遮挡、运动简化或专用捕捉硬件方面存在困难。本文提出AgenticFocus,一个混合现实合成管道,将普通的第一人称人类视频转换为可供机器人训练的演示,通过恢复被遮挡的物体几何形状、重建完整的手部运动,并通过相机相对对齐和分层合成将其重定向到类人形态。生成的数据集将聚焦的视觉观察与同步的机器人动作和状态配对。AgenticFocus在轨迹误差和手腕运动平滑性方面优于跨形态基线,SPARC得分为-5.18,相较于-5.56和-6.05。
🔬 方法详解
问题定义:本论文旨在解决现有类人政策学习方法在处理人类第一人称视角视频时的物体遮挡问题。现有方法往往无法有效恢复被遮挡的物体几何形状,导致运动简化和对专用捕捉硬件的依赖。
核心思路:AgenticFocus的核心思路是利用混合现实技术,通过恢复被遮挡的物体几何形状和重建完整的手部运动,将普通的人类视频转化为适合机器人训练的演示。这种设计使得机器人能够更好地理解和模仿人类的动作。
技术框架:该方法的整体架构包括几个主要模块:首先,通过视频分析恢复被遮挡的物体几何形状;其次,重建手部运动并进行相机相对对齐;最后,利用分层合成技术将这些信息整合到类人形态中。
关键创新:最重要的技术创新在于通过混合现实合成技术有效恢复物体几何形状和手部运动,这与现有方法的简单运动捕捉和处理方式有本质区别。
关键设计:在技术细节上,论文中使用了特定的损失函数来优化物体几何恢复的精度,并设计了适合手部运动重建的网络结构,以确保生成的演示具有高质量和准确性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,AgenticFocus在轨迹误差和手腕运动平滑性方面表现优异,SPARC得分为-5.18,相比于跨形态基线的-5.56和-6.05,显示出显著的性能提升。这表明该方法在处理复杂人类动作时具有更高的准确性和流畅性。
🎯 应用场景
该研究的潜在应用领域包括机器人学习、虚拟现实和增强现实等。通过将人类的第一人称视角视频转化为机器人可训练的演示,AgenticFocus可以帮助机器人更好地理解人类的动作,从而在服务机器人、教育和娱乐等领域发挥重要作用。未来,该技术可能推动更自然的人机交互和智能机器人系统的发展。
📄 摘要(原文)
Human egocentric video is a scalable supervision source for humanoid policy learning, but current pipelines struggle with hand-object occlusion, oversimplified motion, or specialized capture hardware. We introduce AgenticFocus, a Mixed Reality synthesis pipeline that converts ordinary first-person-view human videos into robot-trainable demonstrations by restoring occluded object geometry, reconstructing full-hand motion, and retargeting it to a humanoid embodiment through camera-relative alignment and layered compositing. The resulting dataset pairs focused visual observations with synchronized robot actions and states. AgenticFocus achieves lower trajectory error and smoother wrist motion than cross-embodiment baselines, with SPARC scores of -5.18 versus -5.56 and -6.05.