1st Place Solution of Egocentric 3D Hand Pose Estimation Challenge 2023 Technical Report:A Concise Pipeline for Egocentric Hand Pose Reconstruction

📄 arXiv: 2310.04769v2 📥 PDF

作者: Zhishan Zhou, Zhi Lv, Shihao Zhou, Minqiang Zou, Tong Wu, Mochen Yu, Yao Tang, Jiajun Liang

分类: cs.CV

发布日期: 2023-10-07 (更新: 2023-10-10)


💡 一句话要点

提出基于ViT的回归方法以解决单视角3D手势估计问题

🎯 匹配领域: 支柱六:视频提取与匹配 (Video Extraction)

关键词: 3D手势估计 自我中心 ViT 模型集成 测试时增强 遮挡处理 计算机视觉

📋 核心要点

  1. 现有方法在处理手与物体的遮挡和自我遮挡时性能下降,影响3D手势估计的准确性。
  2. 本研究采用基于ViT的骨干网络和简单回归器,结合多视角结果合并和测试时增强,提升了模型性能。
  3. 我们的模型在测试数据集上实现了12.21mm的MPJPE,成功获得挑战第一名,显示出显著的效果提升。

📝 摘要(中文)

本报告介绍了我们在2023年以自我中心的3D手势估计挑战中的工作。该挑战聚焦于从单视角图像中进行自我中心的3D手势估计。我们采用了基于ViT的骨干网络和简单的回归器进行3D关键点预测,提供了强大的模型基线。我们注意到手与物体的遮挡和自我遮挡会导致性能下降,因此提出了一种非模型方法在后处理阶段合并多视角结果。此外,我们利用测试时增强和模型集成进一步提升了性能。我们还发现公共数据集和合理的预处理对结果有益。我们的方案在测试数据集上达到了12.21mm的MPJPE,获得了自我中心3D手势估计挑战的第一名。

🔬 方法详解

问题定义:本论文旨在解决自我中心3D手势估计中的遮挡问题,现有方法在处理手与物体的遮挡和自我遮挡时表现不佳,导致估计精度下降。

核心思路:我们提出了一种基于ViT的骨干网络与简单回归器的组合,通过后处理阶段合并多视角结果,克服遮挡带来的挑战。

技术框架:整体架构包括数据预处理、模型训练和后处理三个主要阶段。首先进行合理的数据预处理,然后使用ViT进行特征提取,最后在后处理阶段合并多视角结果以提高准确性。

关键创新:本研究的关键创新在于提出了一种非模型方法来合并多视角结果,显著提升了在遮挡情况下的估计性能。这一方法与传统的单视角估计方法有本质区别。

关键设计:我们在模型中采用了特定的损失函数和参数设置,以优化3D关键点的预测精度。同时,测试时增强和模型集成的策略也被有效应用,以进一步提升模型的鲁棒性和准确性。

📊 实验亮点

我们的模型在测试数据集上达到了12.21mm的MPJPE,显著优于其他基线模型,展示了在自我中心3D手势估计中的强大性能,成功获得了挑战第一名。

🎯 应用场景

该研究在虚拟现实、增强现实和人机交互等领域具有广泛的应用潜力。通过精确的3D手势估计,可以提升用户体验和交互的自然性,推动相关技术的发展与应用。

📄 摘要(原文)

This report introduce our work on Egocentric 3D Hand Pose Estimation workshop. Using AssemblyHands, this challenge focuses on egocentric 3D hand pose estimation from a single-view image. In the competition, we adopt ViT based backbones and a simple regressor for 3D keypoints prediction, which provides strong model baselines. We noticed that Hand-objects occlusions and self-occlusions lead to performance degradation, thus proposed a non-model method to merge multi-view results in the post-process stage. Moreover, We utilized test time augmentation and model ensemble to make further improvement. We also found that public dataset and rational preprocess are beneficial. Our method achieved 12.21mm MPJPE on test dataset, achieve the first place in Egocentric 3D Hand Pose Estimation challenge.