WiFi-JEPA: Self-supervised Learning for WiFi-CSI 3D Human Pose Estimation
作者: Doeon Kim, Jungyoon Lee, Seongsin Kim, Seong-heum Kim
分类: cs.CV
发布日期: 2026-07-13
💡 一句话要点
提出WiFi-JEPA以解决WiFi-CSI人类姿态估计中的环境适应性问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: WiFi-CSI 自监督学习 人体姿态估计 隐私保护 光线追踪模拟 深度学习 跨链接相关性
📋 核心要点
- 现有WiFi基础的人体姿态估计方法在环境变化时表现不佳,且依赖昂贵的摄像头标注,限制了其应用规模。
- WiFi-JEPA通过自监督学习,利用掩蔽潜在嵌入的方法,避免了重建原始CSI信号的复杂性,提升了模型的鲁棒性。
- WiFi-JEPA在Person-in-WiFi-3D数据集上取得了最新的性能,超越了之前的WiFi-CSI基线,证明了其有效性。
📝 摘要(中文)
WiFi通道状态信息(CSI)能够在无摄像头环境中实现隐私保护的人体姿态感知,但现有的WiFi基础姿态估计方法在环境变化时常常失效,并依赖于昂贵的基于摄像头的标注流程,限制了其规模。我们提出WiFi-JEPA,一个自监督框架,通过预测掩蔽的潜在嵌入而非重建原始CSI信号,学习CSI原生表示。WiFi-JEPA的三大贡献包括:针对CSI张量的CSI特定标记和链接掩蔽、生成多样化未标记CSI的光线追踪CSI模拟管道,以及在Person-in-WiFi-3D数据集上超越现有WiFi-CSI基线的最新结果。
🔬 方法详解
问题定义:本论文旨在解决WiFi-CSI在环境变化下的人体姿态估计问题。现有方法往往依赖于昂贵的摄像头标注,且在不同环境中表现不稳定。
核心思路:WiFi-JEPA通过自监督学习框架,预测掩蔽的潜在嵌入,而非直接重建原始CSI信号,从而学习到更具鲁棒性的CSI表示。
技术框架:整体架构包括CSI特定的标记和链接掩蔽模块、光线追踪CSI模拟管道和自监督学习目标。模型通过掩蔽不同的Tx-Rx天线链接,迫使其从其他链接中预测空间视图,捕捉3D空间结构的跨链接相关性。
关键创新:WiFi-JEPA的主要创新在于其CSI特定的标记和链接掩蔽策略,以及生成多样化未标记CSI的光线追踪模拟管道。这些创新使得模型能够在缺乏标注的情况下进行有效的预训练。
关键设计:在设计中,采用了特定的损失函数来优化掩蔽预测的准确性,并通过随机几何原件生成多样化的CSI数据,以增强模型的泛化能力。
🖼️ 关键图片
📊 实验亮点
WiFi-JEPA在Person-in-WiFi-3D数据集上取得了最新的性能,超越了之前的WiFi-CSI基线,特别是在单人和多人3D姿态估计任务中均表现出色。实验结果显示,WiFi-JEPA的性能提升显著,且模拟CSI提供了与真实CSI互补的预训练信号。
🎯 应用场景
该研究具有广泛的应用潜力,特别是在智能家居、安防监控和人机交互等领域。WiFi-JEPA能够在无摄像头的环境中实现高效的人体姿态估计,保护用户隐私,同时降低对昂贵标注数据的依赖,推动相关技术的普及和应用。
📄 摘要(原文)
WiFi Channel State Information (CSI) enables privacy-preserving human pose sensing in camera-denied environments, but existing WiFi-based pose estimators often fail under environment shifts and rely on costly camera-based annotation pipelines that limit scale. We propose WiFi-JEPA, a self-supervised framework that learns CSI-native representations by predicting masked latent embeddings instead of reconstructing raw CSI signals that may contain hardware-specific artifacts. WiFi-JEPA makes three contributions: (i) CSI-specific tokenization and link masking tailored to the CSI tensor over channel, time, and link (C,T,L); masking entire Tx-Rx antenna links forces the model to predict one spatial link view from others, capturing cross-link correlations informative of 3D spatial structure. (ii) A ray-tracing CSI simulation pipeline that generates diverse unlabeled CSI from randomized geometric primitives, providing scalable pre-training data without pose annotations. (iii) State-of-the-art results on Person-in-WiFi-3D: WiFi-JEPA outperforms prior WiFi-CSI baselines on both single- and multi-person 3D pose estimation under the same evaluation protocol. We also show that simulated CSI provides complementary pre-training signal to real CSI, and that four vision-native SSL objectives degrade performance below training from scratch, whereas WiFi-JEPA consistently improves downstream pose estimation.