EgoExoMoCap: Distributed Ego-Exo Human Motion Capture
作者: Jiaxi Jiang, Bharat Lal Bhatnagar, Nan Yang, Lingni Ma, Sebastian Starke, Robin Kips, Nadine Bertsch, Christian Holz, Federica Bogo
分类: cs.CV, cs.AI, cs.GR, cs.HC, cs.RO
发布日期: 2026-07-20
💡 一句话要点
提出EgoExoMoCap以解决人类运动捕捉的局限性
🎯 匹配领域: 支柱六:视频提取与匹配 (Video Extraction) 支柱七:动作重定向 (Motion Retargeting) 支柱八:物理动画 (Physics-based Animation) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 人类运动捕捉 头戴设备 多模态信号 虚拟现实 增强现实 鲁棒性 运动重建
📋 核心要点
- 现有的人类运动捕捉方法往往局限于自我中心或外部中心的单一跟踪方式,缺乏有效的联合利用。
- 本文提出的EgoExoMoCap框架通过佩戴智能眼镜的多用户系统,结合自我中心和外部中心信号进行运动捕捉。
- 在真实场景数据集上的实验结果表明,该方法在噪声和遮挡情况下仍能有效重建运动,显示出显著的鲁棒性。
📝 摘要(中文)
人类运动捕捉技术通过头戴设备(HMD)提供了一种可扩展的方式来获取真实世界的人类运动和交互数据,这对于具身人工智能和虚拟现实/增强现实应用至关重要。现有方法主要集中在自我中心的身体跟踪或外部中心的跟踪上,二者大多是孤立研究。本文提出了一种新颖的分布式框架,联合利用自我中心和外部中心的多模态信号进行人类运动估计。与传统的需要大型多摄像头设置或笨重运动捕捉服的系统不同,EgoExoMoCap方法仅需两人或更多人佩戴智能眼镜。该方法利用头部(及可能的手腕)跟踪信号来准确估计三维世界中的全局运动,并结合基于DINOv3的上下文感知图像特征,以在噪声和遮挡的情况下实现鲁棒性。大量在真实场景数据集上的实验表明,该方法能够在具有挑战性的场景中稳健地重建运动。
🔬 方法详解
问题定义:本文旨在解决现有运动捕捉方法在自我中心和外部中心跟踪上的局限性,尤其是在复杂环境下的鲁棒性不足问题。
核心思路:EgoExoMoCap框架通过结合佩戴智能眼镜的多用户系统,利用自我中心和外部中心的多模态信号,提供了一种新颖的运动捕捉解决方案。这样的设计使得系统更加灵活且易于部署。
技术框架:该方法的整体架构包括头部和手腕的运动跟踪模块,以及基于DINOv3的上下文感知图像特征提取模块。通过这些模块的协同工作,实现了对三维运动的准确估计。
关键创新:最重要的技术创新在于将自我中心和外部中心的信号进行联合利用,突破了传统方法的局限,使得运动捕捉在复杂环境中更为鲁棒。
关键设计:在设计中,采用了多模态信号融合技术,结合了头部和手腕的运动数据,并使用DINOv3提取上下文特征,以增强系统在噪声和遮挡情况下的表现。
🖼️ 关键图片
📊 实验亮点
在真实场景数据集上的实验结果显示,EgoExoMoCap在运动重建任务中表现出色,相较于传统方法,鲁棒性提升显著,尤其在噪声和遮挡情况下,运动重建的准确性得到了有效保障。
🎯 应用场景
EgoExoMoCap的研究成果在多个领域具有潜在应用价值,包括虚拟现实、增强现实和具身人工智能等。通过提供更为灵活和高效的运动捕捉解决方案,该技术能够改善人机交互体验,推动相关应用的发展。
📄 摘要(原文)
Human motion capture from head-mounted devices (HMDs) offers a scalable way to acquire real-world human motion and interaction data, which is crucial for applications in embodied AI and VR/AR. Existing approaches focus on either egocentric body tracking, estimating the motion of the subject wearing the device, or exocentric tracking, capturing the movements of people in the wearer's surroundings. So far, these two paradigms have largely been explored in isolation. In this paper, we propose a novel distributed framework that jointly leverages ego- and exocentric multi-modal signals for human motion estimation from HMDs. Unlike traditional motion capture systems requiring bulky multi-camera setups or obtrusive mocap suits, our approach, EgoExoMoCap, is as simple as two (or more) people, each wearing a pair of smart glasses. The method leverages head (plus potentially wrist) tracking signals for accurate estimation of global motion in the 3D world and combines context-aware image features based on DINOv3 to achieve robustness in the presence of noise and occlusions. Extensive experiments on two in-the-wild datasets show that our approach can robustly reconstruct motion even in challenging scenarios.