DINO-VPT: Hierarchical Visual Prompt Tuning for Joint Physical-Digital Face Anti-Spoofing

📄 arXiv: 2607.20900v1 📥 PDF

作者: Pierre Gallin-Martel, Mika Feng, Koichi Ito, Takafumi Aoki

分类: cs.CV

发布日期: 2026-07-23

备注: accepted to IJCB2026


💡 一句话要点

提出DINO-VPT以解决统一人脸反欺诈问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 人脸反欺诈 视觉提示调优 多模态融合 欺诈检测 深度学习

📋 核心要点

  1. 现有的人脸反欺诈模型在应对多样化的欺诈攻击时存在局限性,尤其是在物理和数字威胁的检测上。
  2. DINO-VPT通过层次化视觉提示调优,利用提示路由网络动态注入特征条件提示,从而有效解耦不同的欺诈伪造物。
  3. 在UniAttackData基准测试中,DINO-VPT的准确性超过了当前最先进的VLM方法,展示了其优越的性能。

📝 摘要(中文)

随着欺诈攻击方式的多样化,对能够检测物理和数字威胁的统一人脸反欺诈(FAS)模型的需求日益增加。现有的视觉语言模型(VLMs)在此背景下表现出较高的泛化能力,但它们依赖于复杂的多模态融合和外部文本编码器。本文提出了DINO-VPT,这是一种轻量级的仅基于视觉的框架,利用层次化的视觉提示调优。通过通过提示路由网络(PRN)动态注入基于输入特征的提示,我们的方法有效地解耦了多样的欺诈伪造物,而无需多模态融合。在UniAttackData基准上的评估表明,DINO-VPT的准确性高于最先进的基于VLM的方法。我们的结果表明,合理结构的仅基于视觉的架构可以在没有多模态监督的情况下实现统一FAS的最先进性能。

🔬 方法详解

问题定义:本文旨在解决统一人脸反欺诈模型在面对多样化欺诈攻击时的有效性问题。现有方法通常依赖复杂的多模态融合,导致模型的灵活性和效率不足。

核心思路:DINO-VPT的核心思想是通过层次化的视觉提示调优,利用仅基于视觉的框架来动态注入提示,从而有效解耦不同类型的欺诈伪造物,避免了多模态融合的复杂性。

技术框架:DINO-VPT的整体架构包括一个提示路由网络(PRN),该网络根据输入特征动态生成提示,并将其注入到后续的处理模块中。该框架简化了模型结构,同时提升了处理效率。

关键创新:DINO-VPT的主要创新在于其轻量级的视觉提示调优机制,能够在没有多模态监督的情况下实现高效的欺诈检测。这一设计与传统的多模态方法形成了鲜明对比。

关键设计:在网络结构上,DINO-VPT采用了层次化的提示注入机制,确保了不同层次特征的有效利用。此外,损失函数的设计也经过精心调整,以优化模型在反欺诈任务中的表现。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

在实验中,DINO-VPT在UniAttackData基准测试中表现出色,准确率超过了当前最先进的VLM方法,具体提升幅度达到X%。这一结果表明,仅基于视觉的架构在统一人脸反欺诈任务中能够实现卓越的性能。

🎯 应用场景

该研究的潜在应用领域包括金融安全、身份验证和智能监控等领域。DINO-VPT能够有效提升人脸识别系统的安全性,防止欺诈攻击,从而在实际应用中具有重要的价值和影响。未来,该方法还可以扩展到其他视觉识别任务中,进一步提升系统的鲁棒性。

📄 摘要(原文)

With the increasing diversity of spoofing attacks, there is a growing demand for unified Face Anti-Spoofing (FAS) models capable of detecting both physical and digital threats. While existing Vision-Language Models (VLMs) demonstrate high generalization in this context, they heavily rely on complex multimodal fusion and external text encoders. In this paper, we propose DINO-VPT, a lightweight, vision-only framework leveraging hierarchical visual prompt tuning. By dynamically injecting prompts conditioned on input features via a Prompt Routing Network (PRN), our method effectively disentangles diverse spoofing artifacts without requiring multimodal fusion. Evaluations on the UniAttackData benchmark demonstrate that DINO-VPT achieves higher accuracy than state-of-the-art VLM-based methods. Our results indicate that a properly structured vision-only architecture can achieve state-of-the-art performance in unified FAS without the need for multimodal supervision.