CanonicalPhys: Pose-Robust Remote Photoplethysmography via Canonical-Space Priors

📄 arXiv: 2607.15995 📥 PDF

作者: Hui Wei, Seyedata Jodeiri Seyedian, Xiaobai Li, Guoying Zhao

分类: cs.CV, cs.LG

发布日期: 2026-07-20


💡 一句话要点

提出CanonicalPhys以解决姿态鲁棒性差的问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱八:物理动画 (Physics-based Animation)

关键词: 远程光电容积描记 姿态鲁棒性 深度学习 知识蒸馏 单应性变换 生理信号监测 心率估计

📋 核心要点

  1. 现有的rPPG方法在面部姿态变化时性能显著下降,导致心率估计误差增加。
  2. CanonicalPhys通过引入四点单应性变换,固定面部锚点在规范位置,从而解决姿态对rPPG的影响。
  3. 在相同参数数量下,CanonicalPhys将MAE降幅从1.60倍降低至1.33倍,且在多数据集上表现出高达32%的性能提升。

📝 摘要(中文)

深度远程光电容积描记(rPPG)在正面静止人脸上能达到亚心跳每分钟的误差,但在头部姿态变化时性能急剧下降。现有的FactorizePhys方法在姿态变化时的平均绝对误差(MAE)增加了1.60倍。本文认为姿态是一个坐标结构的干扰,而非数据增强问题。为此,提出了CanonicalPhys,通过引入可微分的四点单应性变换,将四个面部锚点固定在规范位置,从而使得三种先验知识能够在每个像素上表达。实验结果表明,CanonicalPhys显著降低了姿态变化带来的MAE降幅,提升了模型的鲁棒性。

🔬 方法详解

问题定义:本文旨在解决深度远程光电容积描记(rPPG)在面部姿态变化时的鲁棒性不足问题。现有方法在姿态变化时,像素与解剖结构的映射关系不稳定,导致心率估计误差显著增加。

核心思路:论文提出CanonicalPhys,通过引入可微分的四点单应性变换,将面部特征固定在规范位置,从而使得在不同姿态下的先验知识得以有效利用。这样设计的目的是为了消除姿态变化带来的干扰,保持解剖结构与像素映射的一致性。

技术框架:CanonicalPhys的整体架构包括四个主要模块:首先,通过四点单应性变换固定面部锚点;其次,利用每个像素的Lambertian权重表达先验知识;接着,实施跨区域的时间一致性损失;最后,通过知识蒸馏从窗口化的色度信息中提取知识。

关键创新:CanonicalPhys的主要创新在于引入了可微分的单应性变换,使得在不同姿态下的先验知识能够有效表达,而不增加额外的可训练参数。这一设计与现有方法的本质区别在于,解决了姿态变化对解剖结构映射的影响。

关键设计:在损失函数设计上,采用了跨区域时间一致性损失和知识蒸馏策略,确保了模型在不同姿态下的鲁棒性。此外,CanonicalPhys在参数设置上与FactorizePhys保持一致,确保了模型的可比性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,CanonicalPhys在相同参数数量下,将MMPD数据集中正面到大偏航的MAE降幅从1.60倍降低至1.33倍,且在轻微偏航的情况下,降幅从1.32倍降低至1.07倍。此外,在多个数据集上,模型的MAE降低幅度高达32%。

🎯 应用场景

该研究在健康监测、远程医疗和人机交互等领域具有广泛的应用潜力。通过提高rPPG在不同姿态下的鲁棒性,可以实现更准确的心率监测,进而推动智能穿戴设备和远程健康监测系统的发展。未来,该技术有望在实时生理信号监测中发挥重要作用。

📄 摘要(原文)

Deep remote photoplethysmography (rPPG) attains sub-bpm heart-rate error on frontal, stationary faces yet degrades sharply under head pose: on MMPD, the state-of-the-art FactorizePhys backbone's MAE grows $1.60\times$ from frontal ($|\text{yaw}|{<}15^\circ$) to large-yaw ($|\text{yaw}|{\geq}45^\circ$) frames. We argue that pose is a \emph{coordinate-structural} nuisance rather than a data-augmentation problem: in image coordinates the same pixel maps to different anatomy at different poses, blocking three priors otherwise natural for rPPG, namely the dichromatic reflection model, pulse-phase invariance across skin regions, and the POS/CHROM chromaticity projection, each of which presumes a stable anatomy-to-pixel mapping. We introduce \textbf{CanonicalPhys}, which prepends a differentiable four-point homography that fixes four facial anchors at canonical positions; in this canonical frame the three priors become expressible as a per-pixel Lambertian weight, a cross-ROI temporal consistency loss, and knowledge distillation from windowed POS, none of which adds trainable parameters over the backbone. At an identical parameter count, CanonicalPhys reduces MMPD's frontal-to-large-yaw MAE degradation from $1.60\times$ to $1.33\times$ and flattens the mild-yaw bin from $1.32\times$ to $1.07\times$ (across CanonicalPhys variants), with matched cross-dataset MAE reductions of up to $32\%$ on pose-rich targets. Code:this https URL