Factor-Informed Uncertainty Distillation for Gaze Estimation
作者: Mohammadreza Jamalifard, Yaxiong Lei, Javier Fumanal Idocin, Parastoo Azizinezhad, Tom Foulsham, Javier Andreu-Perez
分类: cs.CV, cs.HC
发布日期: 2026-07-22
期刊: ETRA, 2026, 11, 1-7
💡 一句话要点
提出因子引导的不确定性蒸馏以提升注视估计精度
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 注视估计 不确定性蒸馏 教师-学生框架 图像质量 深度学习 课程学习 排名监督
📋 核心要点
- 现有的注视估计方法在非受控环境中表现不佳,难以有效拒绝不可靠的预测。
- 本文提出因子引导的不确定性蒸馏(FIUD),通过教师-学生框架将不确定性与图像质量因素对齐。
- 在多个数据集上,FIUD显著提升了不确定性评估和预测选择性,尤其在非受控场景中效果最佳。
📝 摘要(中文)
深度注视估计在受控环境下表现良好,但在非受控环境中性能下降,系统需拒绝不可靠的预测。单次不确定性推断(如异方差回归)从像素中推断不确定性,但缺乏明确的输入有效性线索,而基于采样的方法通常成本过高,无法实时使用。本文提出因子引导的不确定性蒸馏(FIUD),一个教师-学生框架,将不确定性与可解释的图像质量失效模式对齐。通过课程学习和排名监督,神经学生从教师预测的光照、清晰度、眼睛可见性和对称性等因子中提取信号,形成轻量级的单次不确定性头。在ETH-XGaze、Gaze360和MPIIFaceGaze(超过30万样本)上,FIUD在不确定性、误差排名相关性和选择性预测方面优于确定性和基于采样的基线,尤其在非受控环境中表现出显著提升。
🔬 方法详解
问题定义:本文旨在解决深度注视估计在非受控环境中性能下降的问题,现有方法在推断不确定性时缺乏有效的输入有效性线索,导致不可靠预测未被拒绝。
核心思路:提出因子引导的不确定性蒸馏(FIUD),通过教师-学生框架,利用可解释的图像质量因子(如光照、清晰度等)来引导不确定性推断,从而提高预测的可靠性。
技术框架:FIUD框架包括一个梯度提升的教师模型和一个神经网络学生模型。教师模型预测基于图像质量因子的期望注视误差,学生模型通过课程学习和排名监督提炼这些信号,形成一个轻量级的不确定性头。
关键创新:FIUD的主要创新在于将不确定性推断与图像质量的可解释因子结合,显著提高了在非受控环境中的性能,与传统的单次推断方法相比,提供了更为可靠的预测。
关键设计:在模型设计中,教师模型采用梯度提升算法,学生模型则使用轻量级的神经网络结构,损失函数结合了课程学习和排名监督,确保学生模型有效学习教师模型的知识。具体参数设置和网络结构细节在实验部分进行了详细描述。
🖼️ 关键图片
📊 实验亮点
在ETH-XGaze、Gaze360和MPIIFaceGaze数据集上,FIUD在不确定性评估和误差排名相关性方面均显著优于确定性和基于采样的基线,尤其在非受控环境中,提升幅度最大,展示了其在实际应用中的有效性。
🎯 应用场景
该研究的潜在应用领域包括人机交互、虚拟现实和增强现实等场景,能够提升系统在复杂环境下的注视估计精度,进而改善用户体验。未来,FIUD方法可扩展到其他视觉任务中,提高不确定性评估的可靠性。
📄 摘要(原文)
Deep gaze estimation works well in controlled capture but degrades in unconstrained settings, where systems must reject unreliable predictions. Single-pass uncertainty (e.g., heteroscedastic regression) infers uncertainty from pixels without explicit input-validity cues, while sampling based methods are often too costly for real time use. We propose Factor-Informed Uncertainty Distillation (FIUD), a teacher-student framework that aligns uncertainty with interpretable image-quality failure modes. A gradient-boosting teacher predicts expected gaze error from factors such as illumination, sharpness, eye visibility and symmetry; a neural student distills these signals via curriculum learning and ranking supervision into a lightweight single-pass uncertainty head. Across ETH-XGaze, Gaze360, and MPIIFaceGaze (>300k samples), FIUD improves uncertainty, error rank correlation and selective prediction versus deterministic and sampling-based baselines, with the largest gains in unconstrained settings.