SAM 3D Body: Robust Full-Body Human Mesh Recovery
作者: Xitong Yang, Devansh Kukreja, Don Pinkus, Anushka Sagar, Taosha Fan, Jinhyung Park, Soyong Shin, Jinkun Cao, Jiawei Liu, Nicolas Ugrinovic, Matt Feiszli, Jitendra Malik, Piotr Dollar, Kris Kitani
分类: cs.CV
发布日期: 2026-02-17
备注: Code: https://github.com/facebookresearch/sam-3d-body
💡 一句话要点
提出SAM 3D Body以解决单图像全身3D人类网格恢复问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics) 支柱六:视频提取与匹配 (Video Extraction)
关键词: 3D人类网格恢复 动量人类骨架 编码器-解码器架构 用户提示 多阶段注释
📋 核心要点
- 现有方法在复杂环境下的全身3D人类网格恢复存在准确性不足和泛化能力差的问题。
- 论文提出的SAM 3D Body模型通过动量人类骨架解耦骨骼结构与表面形状,采用编码器-解码器架构并支持用户提示。
- 实验结果显示,3DB在多样化条件下的表现优于现有方法,尤其在用户偏好和定量分析中均有显著提升。
📝 摘要(中文)
我们介绍了SAM 3D Body (3DB),这是一个用于单图像全身3D人类网格恢复的可提示模型,展示了在多样化的野外条件下的最先进性能,具有强大的泛化能力和一致的准确性。3DB能够估计身体、脚和手的姿态。它是第一个使用新的参数化网格表示法——动量人类骨架(MHR)的模型,该模型将骨骼结构与表面形状解耦。3DB采用编码器-解码器架构,并支持辅助提示,包括2D关键点和掩码,类似于SAM系列模型的用户引导推理。我们通过多阶段注释管道生成高质量注释,使用手动关键点注释、可微优化、多视角几何和密集关键点检测的各种组合。我们的数据引擎有效选择和处理数据,以确保数据多样性,收集不寻常的姿态和稀有成像条件。我们提出了一个按姿态和外观类别组织的新评估数据集,能够对模型行为进行细致分析。实验结果表明,3DB在定性用户偏好研究和传统定量分析中均显著优于先前方法。
🔬 方法详解
问题定义:论文要解决的具体问题是如何从单幅图像中准确恢复全身3D人类网格。现有方法在复杂环境下的表现不佳,尤其是在姿态多样性和成像条件变化时,准确性和泛化能力不足。
核心思路:论文的核心解决思路是引入动量人类骨架(MHR)作为新的参数化网格表示法,解耦骨骼结构与表面形状,从而提高模型的灵活性和准确性。通过支持用户提示,模型能够更好地适应不同的输入条件。
技术框架:整体架构采用编码器-解码器设计,包含多个模块:首先,通过编码器提取输入图像特征,然后利用解码器生成3D网格。此外,模型支持2D关键点和掩码等辅助提示,增强推理能力。
关键创新:最重要的技术创新点是动量人类骨架(MHR)的引入,它与传统方法相比,能够更有效地解耦骨骼结构与表面形状,提升了模型的表现和适应性。
关键设计:在参数设置上,模型采用多阶段注释管道,结合手动关键点注释和可微优化技术,确保高质量的训练数据。此外,损失函数设计上考虑了多视角几何和密集关键点检测,以提高模型的准确性和鲁棒性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,SAM 3D Body在多样化的野外条件下表现优越,尤其在用户偏好研究中,获得了显著的正面反馈。与传统方法相比,3DB在准确性和泛化能力上均有显著提升,具体性能数据尚未披露。
🎯 应用场景
该研究的潜在应用领域包括虚拟现实、增强现实、游戏开发以及人机交互等。通过准确恢复3D人类网格,能够提升用户体验,增强虚拟环境中的交互性和沉浸感。此外,未来可能在医疗、运动分析等领域发挥重要作用。
📄 摘要(原文)
We introduce SAM 3D Body (3DB), a promptable model for single-image full-body 3D human mesh recovery (HMR) that demonstrates state-of-the-art performance, with strong generalization and consistent accuracy in diverse in-the-wild conditions. 3DB estimates the human pose of the body, feet, and hands. It is the first model to use a new parametric mesh representation, Momentum Human Rig (MHR), which decouples skeletal structure and surface shape. 3DB employs an encoder-decoder architecture and supports auxiliary prompts, including 2D keypoints and masks, enabling user-guided inference similar to the SAM family of models. We derive high-quality annotations from a multi-stage annotation pipeline that uses various combinations of manual keypoint annotation, differentiable optimization, multi-view geometry, and dense keypoint detection. Our data engine efficiently selects and processes data to ensure data diversity, collecting unusual poses and rare imaging conditions. We present a new evaluation dataset organized by pose and appearance categories, enabling nuanced analysis of model behavior. Our experiments demonstrate superior generalization and substantial improvements over prior methods in both qualitative user preference studies and traditional quantitative analysis. Both 3DB and MHR are open-source.