Face Age Verification Vulnerabilities Under Simple Appearance Manipulations

📄 arXiv: 2607.24194v1 📥 PDF

作者: Ioannis Sarridis, Ioannis Kompatsiaris, Symeon Papadopoulos

分类: cs.CV

发布日期: 2026-07-27


💡 一句话要点

提出面部年龄验证系统的脆弱性研究以应对外观操控问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 年龄验证 视觉操控 模型鲁棒性 偏差缓解 多模态模型

📋 核心要点

  1. 现有的年龄验证系统在面对未成年人通过简单外观变化(如画胡须或涂口红)进行欺骗时,表现出明显的脆弱性。
  2. 本文通过模拟未成年人可轻松实现的视觉变化,系统评估了多种模型在年龄验证中的鲁棒性,提出了偏差缓解的方法。
  3. 实验结果显示,在绘制胡须的情况下,最高61%的真负样本被错误分类为假阳性,且不同人群对操控的敏感性存在显著差异。

📝 摘要(中文)

在线平台越来越依赖自动化年龄估计系统来执行最低年龄政策。针对这一任务设计的基于视觉的模型,其对未成年人可能使用的简单外观变化的鲁棒性引发了关注。本文系统研究了年龄验证的鲁棒性,通过模拟未成年人可以轻松实现的视觉变化,评估了七种模型在三个数据集和四种操控类型下的表现。研究发现,在绘制胡须的情况下,最高可达61%的真负样本被错误分类为假阳性。此外,研究还探讨了不同人群在这些操控下的影响,发现印度人受到胡须操控的影响更大,而女性在所有操控中均受到的影响大于男性。最后,研究探讨了如何在轻量线性探测设置中使用偏差缓解方法来减轻这些偏差。

🔬 方法详解

问题定义:本文旨在解决现有年龄验证系统在面对简单外观操控时的脆弱性,尤其是未成年人通过轻微的外观变化来规避系统的挑战。现有方法未能有效识别这些操控,导致误判。

核心思路:论文通过系统模拟未成年人可能使用的视觉操控,评估多种模型的鲁棒性,并探讨如何通过偏差缓解方法来改善模型的性能。

技术框架:研究采用了七种不同的模型,包括视觉模型、视觉-语言模型和多模态大语言模型,评估其在三个数据集和四种操控类型下的表现。

关键创新:最重要的创新在于系统性地评估了不同外观操控对年龄验证模型的影响,并揭示了不同人群在这些操控下的敏感性差异。与现有研究相比,本文提供了更全面的分析和解决方案。

关键设计:研究中使用了多种数据集和操控类型,设置了适当的评估指标,采用了轻量线性探测方法来实现偏差缓解,确保了实验的可重复性和可靠性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,在绘制胡须的情况下,最高61%的真负样本被错误分类为假阳性,表明现有模型在此类操控下的脆弱性。此外,研究发现女性在所有操控中受到的影响普遍大于男性,而印度人对胡须操控的敏感性更高,这为模型的改进提供了重要依据。

🎯 应用场景

该研究的潜在应用领域包括社交媒体平台、在线游戏和电子商务等需要年龄验证的场景。通过提高年龄验证系统的鲁棒性,可以有效减少未成年人绕过年龄限制的可能性,保护青少年用户的安全。同时,研究结果也为未来的算法设计提供了重要的参考。

📄 摘要(原文)

Online platforms increasingly rely on automated age estimation systems to enforce minimum-age policies. Focusing on vision-based models designed for this task, concerns arise regarding their robustness to simple appearance changes that underage individuals may use to bypass such systems, such as drawing a mustache or applying lipstick. In this work, we present a systematic study of age verification robustness by simulating visual alterations that can be easily achieved by underage individuals. We evaluate seven models, including vision, vision-language, and multimodal large language models, across three datasets and four manipulation types. Interestingly, under drawn beard stubble, up to 61% of True Negatives are flipped into False Positives. Furthermore, we investigate how different demographics are affected by such manipulations, finding that Indians are more affected by beard stubble manipulations, while females are more affected than males across all manipulations. Finally, we explore how these biases can be mitigated using bias mitigation methodologies in lightweight linear probe settings.