EquiFusion: Kinematics-Agnostic Human Motion Prediction via Equivariant Latent Diffusion
作者: Cecilia Curreli, Florian Hofherr, Dominik Muhle, Abhishek Saroha, Riccardo Marin, Daniel Cremers
分类: cs.CV, cs.AI, cs.HC, cs.LG
发布日期: 2026-07-13
备注: Accepted to ECCV 2026. Visit our webpage at https://ceveloper.github.io/publications/equifusion/
🔗 代码/项目: PROJECT_PAGE
💡 一句话要点
提出EquiFusion以解决人类运动预测中的运动学限制问题
🎯 匹配领域: 支柱七:动作重定向 (Motion Retargeting) 支柱八:物理动画 (Physics-based Animation)
关键词: 人类运动预测 运动学无关 潜在扩散模型 置换等变架构 跨数据集泛化 零样本学习 计算机视觉 机器学习
📋 核心要点
- 现有的运动预测模型因运动学硬编码而限制了泛化能力,无法有效处理不同数据集。
- EquiFusion通过引入置换等变架构的潜在扩散模型,解决了运动学无关性的问题。
- 该模型在多个基准测试中表现优异,体积更小且训练速度更快,提升了75%的效率。
📝 摘要(中文)
现有的随机3D人类运动预测模型受到运动学硬编码的限制,导致其泛化能力不足,无法进行跨数据集训练,并且需要复杂的数据重定向。为了解决这一瓶颈,本文提出了EquiFusion,这是第一个运动学无关的模型,采用了具有置换等变架构的潜在扩散模型。EquiFusion将运动学的连接性视为显式输入参数,确保其内部计算本质上与关节顺序和图结构无关。这一新颖设计使得模型能够在未见过的运动学上实现真正的跨数据集泛化,并开启了新的零样本方向,如从部分或遮挡观察中进行运动预测和目标肢体生成。EquiFusion在主要基准测试中取得了最先进的结果,其模型体积比以往运动学特定方法小75%,同时训练和推理速度更快。因此,EquiFusion为稳健的人类运动预测建立了新的灵活标准。
🔬 方法详解
问题定义:本文旨在解决现有随机3D人类运动预测模型因运动学硬编码而导致的泛化能力不足、跨数据集训练困难及复杂数据重定向的问题。
核心思路:EquiFusion的核心思想是将运动学的连接性作为显式输入,设计为运动学无关的模型,使得内部计算不受关节顺序和图结构的影响,从而实现更好的泛化能力。
技术框架:EquiFusion采用潜在扩散模型,结合置换等变架构,整体流程包括数据输入、特征提取、运动预测和输出生成等主要模块。
关键创新:EquiFusion的主要创新在于其运动学无关性设计,使得模型能够在未见过的运动学上进行有效预测,与传统方法相比,显著提高了泛化能力。
关键设计:模型的关键设计包括置换等变网络结构、损失函数的选择以及对输入参数的灵活处理,确保了模型在不同运动学条件下的鲁棒性。
🖼️ 关键图片
📊 实验亮点
EquiFusion在主要基准测试中取得了最先进的结果,相比于以往的运动学特定方法,其模型体积缩小了75%,并且训练和推理速度显著提升,展示了其在实际应用中的优越性和效率。
🎯 应用场景
EquiFusion的研究成果在多个领域具有广泛的应用潜力,包括虚拟现实、动画制作、运动分析和人机交互等。其运动学无关的特性使得模型能够适应不同的运动数据,提升了运动预测的灵活性和准确性,未来可能推动相关技术的进一步发展。
📄 摘要(原文)
Existing Stochastic 3D Human Motion Prediction models are fundamentally constrained by hard-coding the skeleton kinematics, severely limiting generalization, preventing cross-dataset training, and requiring complex data retargeting. We introduce EquiFusion, the first kinematics-agnostic model to solve this bottleneck, implementing a latent diffusion model with a permutation equivariant architecture. EquiFusion treats the kinematics' connectivity as an explicit input parameter, ensuring its internal computations are inherently agnostic to joint ordering and graph structure. This novel design enables truly cross-dataset generalization to unseen kinematics and unlocks novel zero-shot directions, such as motion prediction from partial or occluded observations and targeted limb generation. EquiFusion achieves state-of-the-art results on major benchmarks, being up to 75% more compact than previous kinematics-specific methods, while achieving faster training and inference. EquiFusion thus establishes a new, flexible standard for robust human motion prediction. Model and training code are available at https://ceveloper.github.io/publications/equifusion/.