Two-Stage Multi-Modal Fusion with Adaptive Alignment for Action Quality Assessment
作者: Kanglei Zhou, Ruizhi Cai, Xinning Wang, Yijian Zheng, Liyuan Wang, Jianguo Li, Xiaohui Liang
分类: cs.CV
发布日期: 2026-07-08
备注: Accepted to IJCV
💡 一句话要点
提出DualAlign以解决多模态融合中的对齐与稳定性问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 动作质量评估 多模态融合 自适应对齐 视觉表示 数据集构建 性能提升 鲁棒性
📋 核心要点
- 现有的单模态方法在真实场景中难以捕捉运动质量的细微线索,导致评估效果不佳。
- 本文提出DualAlign框架,通过自适应对齐和两阶段融合,提升多模态信息的有效性和稳定性。
- 实验结果显示,DualAlign在多个基准上显著提升评估性能,尤其在数据稀缺和模态缺失情况下表现出色。
📝 摘要(中文)
动作质量评估(AQA)旨在评估个人运动表现的优劣,广泛应用于体育评分、技能评估和医疗保健等领域。然而,单模态方法在捕捉运动质量的细微线索方面存在困难。尽管多模态输入提供了互补信息,现有方法仍面临跨模态错位和不稳定融合的挑战。为此,本文提出了DualAlign,一个具有自适应对齐的两阶段多模态融合框架。该框架首先通过最大化RGB视频、光流和骨架模态之间的共享结构信息来构建一致的视觉表示,随后在视觉稳定后引入文本语义,以高层次描述补充而非扭曲底层视觉流形。我们还引入了MM--JDM数据集,以评估框架在现实多模态条件下的表现。实验结果表明,DualAlign在MM--JDM上相较于现有方法提高了21.16%的平均相关性,并在RG和Fis-V基准上分别获得了3.53%和5.95%的提升。
🔬 方法详解
问题定义:本文旨在解决动作质量评估中的多模态融合问题,现有方法在跨模态对齐和融合稳定性方面存在不足,导致评估效果不理想。
核心思路:DualAlign框架通过两阶段处理,首先构建一致的视觉表示,然后引入文本信息,以增强评估的准确性和稳定性。这样的设计旨在最大化模态间的共享信息,减少信息干扰。
技术框架:DualAlign的整体架构包括两个主要阶段:第一阶段是通过RGB视频、光流和骨架模态的对齐构建视觉表示,第二阶段是在视觉稳定后引入文本语义,确保高层次描述的有效性。
关键创新:DualAlign的核心创新在于自适应对齐机制,能够有效解决模态间的错位问题,并通过两阶段融合提升信息的稳定性。这与传统方法的单一模态处理形成鲜明对比。
关键设计:在技术细节上,DualAlign采用了特定的损失函数来优化模态对齐,并设计了适应性参数设置,以应对不同模态间的异质性。此外,网络结构经过精心设计,以确保信息流的高效传递。
🖼️ 关键图片
📊 实验亮点
实验结果表明,DualAlign在MM--JDM数据集上相较于现有最先进方法提高了21.16%的平均相关性,并在RG和Fis-V基准上分别获得了3.53%和5.95%的提升。此外,该框架在模态缺失和标签稀缺的情况下仍保持了良好的鲁棒性,显示出其广泛的适用性。
🎯 应用场景
该研究在体育评分、技能评估和医疗保健等领域具有广泛的应用潜力。通过提高动作质量评估的准确性,DualAlign能够为教练、医生和运动员提供更为可靠的反馈,进而促进运动表现的提升和健康管理的优化。未来,该方法还可以扩展到其他需要多模态信息融合的领域,如人机交互和智能监控等。
📄 摘要(原文)
Action Quality Assessment (AQA) aims to evaluate how well a person performs a movement, which is essential in applications such as sports scoring, skill assessment, and healthcare. However, unimodal approaches often struggle to capture subtle cues of movement quality in real-world settings. Although multi-modal inputs provide complementary information, existing methods still face two major challenges: heterogeneous modalities often lead to cross-modal misalignment and unstable fusion, and reliable multi-modal annotation is costly, resulting in limited dataset diversity. To address these challenges, we propose DualAlign, a two-stage multi-modal fusion framework with adaptive alignment. The framework first constructs a coherent visual representation by maximizing shared structural information across RGB video, optical flow, and skeleton modalities. Textual semantics are then incorporated after visual stabilization, allowing high-level descriptions to complement rather than distort the underlying visual manifold. To evaluate the framework under realistic multi-modal conditions, we introduce MM--JDM, a movement-quality assessment dataset integrating RGB videos, optical flow, skeleton sequences, and structured text. MM--JDM naturally exhibits modality noise, class imbalance, and label scarcity, making it a challenging benchmark for studying multi-modal fusion and alignment. Extensive experiments show that DualAlign improves average correlation on MM--JDM by 21.16% over the state-of-the-art methods and achieves gains of 3.53% and 5.95% on the RG and Fis-V benchmarks, respectively. DualAlign also remains robust under missing-modality and label-scarce conditions.