ReMoMask-2: Latent Retrieval-Augmented Masked Motion Generation
作者: Yiran Wang, Zeyu Zhang, Ling Shao, Hao Tang
分类: cs.CV
发布日期: 2026-09-08
备注: Code: https://github.com/AIGeeksGroup/ReMoMask-2. Website: https://aigeeksgroup.github.io/ReMoMask-2
💡 一句话要点
提出ReMoMask-2以解决文本到运动生成中的检索与融合问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱四:生成式动作 (Generative Motion) 支柱七:动作重定向 (Motion Retargeting) 支柱八:物理动画 (Physics-based Animation)
关键词: 文本到运动生成 检索增强 层次性对齐 时空注意力 拓扑结构掩码 对比学习 机器人技术 虚拟现实
📋 核心要点
- 现有的RAG-T2M模型在检索和融合机制上存在粗粒度问题,无法有效捕捉人类运动的层次性和时空拓扑结构。
- 本文提出ReMoMask-2,通过在生成器的潜在空间内重建检索数据库,利用轻量级投影器对齐文本查询,从而改善生成效果。
- 实验结果显示,ReMoMask-2在多个数据集上实现了最先进的准确性,并在推理速度上优于现有方法。
📝 摘要(中文)
文本到运动生成(T2M)将自然语言映射为人类关节运动,广泛应用于游戏、虚拟现实和机器人领域。检索增强文本到运动生成(RAG-T2M)通过检索运动-文本对来改善复杂描述的生成。然而,现有RAG-T2M模型面临两个挑战:粗粒度检索和融合机制忽视了人类运动的层次性和时空拓扑结构,以及检索证据与生成器潜在空间之间存在表示差距。为了解决这些问题,本文提出了ReMoMask-2,通过在生成器的潜在空间内直接重建检索数据库,并通过轻量级投影器对文本查询进行对齐,使生成器能够直接利用检索到的运动语义内容。大量实验表明,ReMoMask-2在KIT-ML和SnapMoGen上达到了最低的FID,并且其单一的掩码变换器阶段超越了ReMoMask的完整两阶段管道,提供了最快的推理速度。
🔬 方法详解
问题定义:本文旨在解决现有RAG-T2M模型在检索和融合机制上的不足,特别是粗粒度检索和表示差距的问题。现有方法未能有效捕捉人类运动的层次性和时空拓扑结构,导致生成效果不佳。
核心思路:ReMoMask-2通过在生成器的潜在空间内重建检索数据库,结合轻量级投影器对文本查询进行对齐,使得生成器能够直接利用检索到的运动语义内容,从而提升生成质量。
技术框架:整体架构包括三个主要模块:层次双向动量对比学习(HBM)用于对齐全局和部分特征与文本;语义时空注意力(SSTA)用于拓扑感知融合;拓扑结构掩码(TSM)用于通过自适应掩码实现稳健的部分级别对接。
关键创新:ReMoMask-2的核心创新在于其在生成器潜在空间内重建检索数据库的能力,使得检索和生成过程在同一语义空间内进行,从而消除了表示差距。
关键设计:在技术细节上,采用了对比学习损失函数来优化HBM模块,SSTA模块则通过多头注意力机制实现拓扑感知,TSM模块则通过自适应掩码策略增强部分级别的对接能力。实验中还优化了模型的参数设置,以提高推理效率。
🖼️ 关键图片
📊 实验亮点
实验结果表明,ReMoMask-2在HumanML3D、KIT-ML和SnapMoGen数据集上达到了最先进的准确性,特别是在KIT-ML和SnapMoGen上实现了最低的FID。此外,其单一的掩码变换器阶段在性能上超越了ReMoMask的完整两阶段管道,并且提供了最快的推理速度。
🎯 应用场景
该研究的潜在应用领域包括游戏开发、虚拟现实体验和机器人控制等。通过提高文本到运动生成的准确性和效率,ReMoMask-2能够为这些领域提供更自然和流畅的人机交互体验,推动相关技术的发展与应用。
📄 摘要(原文)
Text-to-motion (T2M) generation maps natural language to human joint movements, aiding gaming, VR, and robotics. Retrieval-Augmented Text-to-Motion (RAG-T2M) improves generation on complex descriptions by conditioning on retrieved motion-text pairs. However, existing RAG-T2M models face two challenges: coarse-grained retrieval and fusion mechanisms overlook the hierarchical, spatial-temporal topology of human motion, and a representation gap exists because retrieved evidence resides in a semantic space separate from the generator's latents. To address the first, we present ReMoMask, a structure-aware RAG framework coupling Hierarchical Bidirectional Momentum (HBM) contrastive learning to align global and part-level features with text; Semantic Spatial-Temporal Attention (SSTA) for topology-aware fusion; and Topology Structured Masking (TSM) to force robust part-level grounding via adaptive masking. To address the second, we introduce ReMoMask-2, which rebuilds the retrieval database directly within the generator's pre-quantization latent space and aligns text queries via a distilled lightweight projector, allowing the generator to directly consume the retrieved motion's semantic content. Extensive experiments on HumanML3D, KIT-ML, and SnapMoGen demonstrate our retriever achieves state-of-the-art accuracy, while ReMoMask-2 attains the lowest FID on KIT-ML and SnapMoGen; notably, its single mask-transformer stage surpasses ReMoMask's full two-stage pipeline and delivers the fastest inference.