TSR-Ego: Temporally Guided Stereo Refinement Framework for Egocentric 3D Human Pose Estimation

📄 arXiv: 2607.09169v1 📥 PDF

作者: Md Mushfiqur Azam, John Quarles, Kevin Desai

分类: cs.CV

发布日期: 2026-07-10


💡 一句话要点

提出TSR-Ego以解决头戴立体相机下的3D人类姿态估计问题

🎯 匹配领域: 支柱六:视频提取与匹配 (Video Extraction)

关键词: 自我中心姿态估计 立体视觉 时间卷积 可变形注意机制 深度学习 运动捕捉 虚拟现实

📋 核心要点

  1. 现有方法在自我中心3D人类姿态估计中面临鱼眼畸变和自遮挡等挑战,导致鲁棒性不足。
  2. TSR-Ego通过结合短期运动证据与投影引导特征采样,增强了立体特征图的表现力。
  3. 在UnrealEgo2和UnrealEgo-RW数据集上的实验结果显示,TSR-Ego实现了最先进的性能,尤其在真实场景中表现突出。

📝 摘要(中文)

从头戴立体相机获取的自我中心3D人类姿态估计面临鱼眼畸变、严重自遮挡和关节截断等挑战。尽管近期的立体自我中心方法通过热图提升、立体对应和基于变换器的精炼提高了性能,但它们通常过于依赖帧局部证据或将时间信息仅作为辅助的姿态级上下文。这限制了在当前帧立体线索薄弱、遮挡或模糊时的鲁棒性。为此,本文提出了TSR-Ego,一个时间引导的立体框架,结合短期运动证据与投影引导的特征采样。该模型通过因果深度可分离时间卷积丰富密集立体特征图,使过去的视觉证据影响特征空间,随后进行可变形交叉注意。单阶段因果立体解码器通过时间自注意、关节自注意和鱼眼可变形立体交叉注意精炼学习的3D关节查询,利用不断演变的姿态估计生成2D采样参考。与主要在姿态预测后应用时间推理的方法不同,TSR-Ego利用运动上下文来塑造采样的立体特征和关节表示,同时保持在线推理而不依赖未来帧。

🔬 方法详解

问题定义:本文旨在解决从头戴立体相机获取的自我中心3D人类姿态估计中的鱼眼畸变、自遮挡和关节截断等问题。现有方法往往依赖于局部帧信息,导致在复杂场景下的鲁棒性不足。

核心思路:TSR-Ego的核心思路是结合短期运动证据与投影引导特征采样,通过时间卷积增强特征图,使得历史视觉信息能够影响当前的特征表示,从而提高姿态估计的准确性和鲁棒性。

技术框架:该框架包括几个主要模块:首先,通过因果深度可分离卷积增强立体特征图;接着,利用可变形交叉注意机制进行特征融合;最后,单阶段因果立体解码器通过时间自注意和关节自注意精炼3D关节查询。

关键创新:TSR-Ego的创新在于将时间上下文融入特征采样和关节表示的构建中,而不仅仅是在姿态预测后进行时间推理,这使得模型在处理复杂场景时更具鲁棒性。

关键设计:模型采用因果深度可分离卷积和可变形交叉注意机制,确保了特征的有效融合和信息的传递。此外,设计了适应性的损失函数,以优化模型在不同场景下的表现。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在UnrealEgo2和UnrealEgo-RW数据集上的实验结果表明,TSR-Ego在3D人类姿态估计任务中达到了最先进的性能,尤其在真实场景序列中表现出显著的提升,具体性能数据未提供,但提升幅度明显。

🎯 应用场景

该研究在虚拟现实、增强现实和人机交互等领域具有广泛的应用潜力。通过提高自我中心3D人类姿态估计的准确性,TSR-Ego能够为运动捕捉、游戏开发和智能监控等实际应用提供更可靠的技术支持,推动相关技术的发展与应用。

📄 摘要(原文)

Egocentric 3D human pose estimation from head-mounted stereo cameras is challenging due to fisheye distortion, severe self-occlusion, and frequent truncation of body joints outside the camera field of view. Recent stereo egocentric methods have improved performance through heatmap lifting, stereo correspondence, and transformer-based refinement, but they often rely heavily on frame-local evidence or use temporal information only as auxiliary pose-level context. This limits robustness when current-frame stereo cues are weak, occluded, or ambiguous. We propose TSR-Ego, a temporally guided stereo framework that couples short-term motion evidence with projection-guided feature sampling. The model first enriches dense stereo feature maps using a causal depthwise-separable temporal convolution, allowing past visual evidence to influence the feature space before deformable cross-attention. A single-stage causal stereo decoder then refines learned 3D joint queries through temporal self-attention, joint self-attention, and fisheye deformable stereo cross-attention, using the evolving pose estimate to generate 2D sampling references. Unlike methods that apply temporal reasoning mainly after pose prediction, TSR-Ego uses motion context to shape both the sampled stereo features and the joint representations while preserving online inference without future frames. Experiments on UnrealEgo2 and UnrealEgo-RW show state-of-the-art performance, with especially strong gains on real-world sequences.