DETRAM: End-to-end DEtection, Tracking and Recovery of HumAn Meshes
作者: Chunggi Lee, Seonwook Park, Wanhua Li, Umar Iqbal, Hanspeter Pfister
分类: cs.CV
发布日期: 2026-07-10
💡 一句话要点
提出DETRAM以解决多人物体检测与跟踪问题
🎯 匹配领域: 支柱六:视频提取与匹配 (Video Extraction)
关键词: 人体网格恢复 多人物跟踪 变换器解码器 用户提示 实时分析
📋 核心要点
- 现有方法依赖于预训练的人体检测模块,导致运行时间增加且可跟踪实体数量受限。
- DETRAM通过单个变换器解码器实现多人物HMR与跟踪,支持自动与用户提示的跟踪方式。
- 在多个数据集上,DETRAM在跟踪精度上达到最先进水平,并在重建精度上表现出竞争力。
📝 摘要(中文)
在人体网格恢复(HMR)任务中,多人物场景由于存在多个实体及其间的遮挡而特别困难。尤其在视频输入中,需要可靠且一致地跟踪每个实体。现有方法依赖于预训练的人体检测模块,增加了运行时间并限制了可跟踪实体的数量。本文提出DETRAM,一个统一的多人物HMR与跟踪框架,能够自动及通过用户提示同时检测、重建和跟踪人类。DETRAM使用单个变换器解码器,配备跨帧保持一致性的可学习查询嵌入:检测查询发现新的人,跟踪查询维护现有个体的姿态和形状,提示查询跟随用户指定的身份。我们的方案在PoseTrack21、3DPW、BEDLAM和MuPoTS-3D上实现了最先进的跟踪结果,并在BEDLAM和3DPW上具有竞争力的重建精度,同时独特地支持多人物场景中的基于提示的个体跟踪。
🔬 方法详解
问题定义:本文旨在解决多人物场景中人体网格恢复与跟踪的挑战,现有方法因依赖预训练模块而导致效率低下和实体数量限制。
核心思路:DETRAM通过统一的框架,利用单个变换器解码器和可学习的查询嵌入,来同时进行检测、重建和跟踪,旨在提高多人物场景下的跟踪可靠性和效率。
技术框架:DETRAM的整体架构包括三个主要模块:检测查询用于发现新个体,跟踪查询用于维护现有个体的姿态和形状,提示查询用于跟踪用户指定的身份。
关键创新:DETRAM首次将提示能力与多人物HMR和跟踪统一在一个端到端可训练的框架中,显著提升了用户导向的人类分析能力。
关键设计:该方法采用跨帧保持一致性的可学习查询嵌入,设计了特定的损失函数以优化跟踪和重建精度,确保在多人物场景中有效地处理遮挡和身份保持。
🖼️ 关键图片
📊 实验亮点
DETRAM在PoseTrack21、3DPW、BEDLAM和MuPoTS-3D数据集上实现了最先进的跟踪结果,特别是在PoseTrack21上,跟踪精度提升显著,重建精度在BEDLAM和3DPW上也表现出竞争力,展示了其在多人物场景中的有效性。
🎯 应用场景
DETRAM的研究成果在视频监控、虚拟现实、增强现实等领域具有广泛的应用潜力。通过提供高效的人体跟踪与分析能力,该框架能够支持实时交互和用户导向的分析,推动人机交互和行为识别等技术的发展。
📄 摘要(原文)
In the task of human mesh recovery (HMR), multi-person scenes are particularly difficult to handle due to the many entities that appear and occlusions between them over time. In particular for video inputs, there is a need to track each entity reliably and consistently. Existing methods rely on pretrained human detection modules, increasing their runtime and limiting the number of tracked entities. We present DETRAM, a unified framework for multi-person HMR and tracking that simultaneously detects, reconstructs, and tracks humans across time, both automatically and via user prompts. DETRAM uses a single transformer decoder with an identity-consistent set of learnable query embeddings that persist across frames: detection queries discover new people, tracking queries maintain pose and shape for existing individuals, and prompt queries follow user-specified identities. Our approach achieves state-of-the-art tracking results on PoseTrack21, 3DPW, BEDLAM, and MuPoTS-3D, and competitive reconstruction accuracy on BEDLAM and 3DPW, while uniquely supporting prompt-based tracking of individuals in multi-person scenes. To our knowledge, this is the first method to unify promptability and multi-person HMR with tracking in an end-to-end trainable framework, enabling user-directed human analysis in videos.