Adaptive Latent Trajectory Anchoring for Action Segmentation Dataset Condensation
作者: Artheme Gauthier-Villar, Guodong Ding, Angela Yao
分类: cs.CV
发布日期: 2026-07-10
备注: 16 pages, 5 figures, accepted to ECCV 2026
💡 一句话要点
提出自适应潜在轨迹锚定以解决动作分割数据集蒸馏问题
🎯 匹配领域: 支柱七:动作重定向 (Motion Retargeting)
关键词: 动作分割 数据集蒸馏 去噪扩散模型 潜在映射 自适应分配机制
📋 核心要点
- 现有的动作分割数据集蒸馏方法计算成本高,且存在重建过度平滑和时间约束严格的问题。
- 本文提出了一种基于去噪扩散隐式模型的确定性潜在映射方法,旨在提高数据集蒸馏的效率。
- 实验结果显示,所提框架在分割性能上显著超越了现有方法,并在Breakfast数据集上实现了与真实数据训练相当的效果。
📝 摘要(中文)
动作分割的数据集蒸馏旨在合成长时间未修剪视频数据集的紧凑且信息丰富的表示。现有方法依赖于变分自编码器和迭代潜在优化,计算成本高且存在过度平滑重建和严格时间约束的问题。本文提出将蒸馏范式从基于优化的反演转变为确定性潜在映射。通过利用去噪扩散隐式模型,我们将动作片段表示为由稀疏潜在点锚定的连续轨迹。为了最大化表示效率,我们引入了一种自适应分配机制,根据片段重建难度动态重新分配锚定预算。大量实验表明,我们的框架在常见数据集上的分割性能显著优于现有最先进的方法。值得注意的是,我们的方法在Breakfast数据集上以2.4%的蒸馏比例实现了与真实数据训练的性能平齐。
🔬 方法详解
问题定义:本文旨在解决现有动作分割数据集蒸馏方法的高计算成本、重建质量差和时间约束严格等问题。这些问题限制了模型在长视频数据集上的应用效果。
核心思路:论文提出了一种新的蒸馏范式,通过确定性潜在映射而非优化反演来实现数据集的蒸馏。利用去噪扩散隐式模型,动作片段被表示为由稀疏潜在点锚定的连续轨迹,从而提高了表示的灵活性和效率。
技术框架:整体架构包括数据预处理、潜在映射生成和自适应锚定分配三个主要模块。首先对输入视频进行处理,然后通过去噪扩散模型生成潜在表示,最后根据重建难度动态调整锚定点的分配。
关键创新:最重要的创新在于引入了自适应分配机制,使得锚定预算能够根据不同片段的重建难度进行动态调整。这一设计使得模型在处理复杂片段时能够更有效地利用资源。
关键设计:在技术细节上,采用了特定的损失函数来平衡重建质量与锚定点分配的效率,同时网络结构设计上引入了去噪扩散模型,以增强潜在表示的表达能力。具体的参数设置和网络架构细节在实验部分进行了详细描述。
🖼️ 关键图片
📊 实验亮点
实验结果表明,所提框架在多个常见数据集上的分割性能显著优于现有最先进的方法。在Breakfast数据集上,模型以2.4%的蒸馏比例实现了与真实数据训练相当的性能,展示了其在实际应用中的潜力。
🎯 应用场景
该研究的潜在应用领域包括视频监控、体育分析和人机交互等场景。通过提高动作分割的效率和准确性,能够为相关领域提供更高质量的数据支持,推动智能监控和自动化分析的发展。未来,该方法有望在实时视频处理和大规模数据集分析中发挥重要作用。
📄 摘要(原文)
Dataset condensation for action segmentation synthesizes compact, informative representations of long, untrimmed video datasets. The existing approach relies on Variational Autoencoders and an iterative latent optimization; it is computationally expensive and suffers from over-smoothed reconstructions and rigid temporal constraints. This paper proposes to shift the condensation paradigm from optimization-based inversion to deterministic latent mapping. By leveraging Denoising Diffusion Implicit Models, we represent action segments as continuous trajectories anchored by sparse latent points in the noise manifold. To maximize representational efficiency, we introduce an adaptive allocation mechanism that dynamically redistributes the anchoring budget based on segment-wise reconstruction difficulty. Extensive experiments demonstrate that our framework significantly outperforms state-of-the-art methods in segmentation performance across common datasets. Notably, our approach achieves performance parity with real data training while maintaining a condensation ratio of 2.4\% on Breakfast dataset.