Per-Stroke Temporal Control for Text-to-Motion via Action Units and Action-Detection Guidance

📄 arXiv: 2607.15717 📥 PDF

作者: Euijun Jung, Youngki Lee

分类: cs.CV, cs.GR

发布日期: 2026-07-20


💡 一句话要点

提出基于动作单元的时间控制方法以解决文本到运动的时序问题

🎯 匹配领域: 支柱四:生成式动作 (Generative Motion)

关键词: 文本到运动 动作单元 时序控制 动作生成 计算机视觉

📋 核心要点

  1. 现有的文本到运动模型在动作执行时序上存在显著不足,导致动作无法准确分离。
  2. 本文提出通过动作单元(AUs)作为条件信号,明确控制每个动作的时序和轨迹。
  3. 实验结果显示,基于动作单元的模型在StrokeBench上显著提高了动作的正确性和运动质量。

📝 摘要(中文)

文本到运动模型在执行提示命名的动作时表现出色,但在每个动作的时序控制上却不够可靠。本文引入了称为动作单元(Action Units, AUs)的时间事件类型,使得每个动作的轨迹、动作类别、时间窗口和影响时机成为明确的条件信号。通过轻量级的门控适配器将冻结的文本到运动骨干网络与动作单元集结合,并在推理阶段通过冻结的帧级检测器的训练无关分类器梯度来修正残余时序误差。实验结果表明,基于动作单元的控制显著提高了单个动作的正确放置率,并在运动质量上优于文本、时间间隔和帧级基线。

🔬 方法详解

问题定义:本文旨在解决文本到运动模型在动作时序控制上的不足,现有方法往往无法准确分离和定位每个动作的执行时机,导致动作效果不佳。

核心思路:通过引入动作单元(AUs)作为明确的时间事件信号,论文使得每个动作的轨迹、类别、时间窗口和影响时机都能被有效控制,从而提升模型的时序精度。

技术框架:整体架构包括一个冻结的文本到运动骨干网络,通过轻量级的门控适配器与动作单元集结合,适配器注入了每个动作的令牌和每帧的相位通道。在推理阶段,利用训练无关的分类器梯度来修正时序误差。

关键创新:最重要的创新在于将动作单元作为条件信号引入模型,使得每个动作的时序控制变得更加明确和可控,这与现有方法的模糊时序控制形成鲜明对比。

关键设计:在模型设计中,采用了轻量级的门控适配器来处理动作单元的输入,同时在推理阶段通过冻结的帧级检测器来进行时序误差的修正,确保了模型的高效性和准确性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,基于动作单元的模型在StrokeBench上显著提高了单个动作的正确放置率,相较于最强的先前接口,提升幅度明显,且在运动质量上优于文本、时间间隔和帧级基线,展现出最佳的性能表现。

🎯 应用场景

该研究的潜在应用领域包括动画制作、游戏开发和虚拟现实等场景,能够为这些领域提供更为精准的动作生成技术,提升用户体验和交互效果。未来,该方法可能推动更复杂的动作生成和控制技术的发展,促进人机交互的自然性与流畅性。

📄 摘要(原文)

Text-to-motion models are competent at the action a prompt names but unreliable at when each stroke lands: four punches alternating left and right rarely return four separable strokes. We introduce typed temporal events called Action Units (AUs) that make the individual stroke -- its body track, action class, time window, and impact timing -- an explicit conditioning signal. We ground a frozen text-to-motion backbone on the AU set through a lightweight gated adapter injecting two streams (per-stroke tokens and a per-frame phase channel), and at inference close residual timing errors with a training-free classifier gradient from a frozen frame-level detector. We measure per-stroke control on StrokeBench, whose prompts specify count, ordering, track, and core-frame placement, paired with an audited stroke corpus. AU grounding markedly raises the rate of correctly placed single strokes over the strongest prior interface, at the best motion quality among text-, interval-, and frame-level baselines. The prompted core frame emerges as a further steerable axis.