DeepBias: Adaptive In-depth Probing of Social Biases in LVLMs
作者: Anqi Li, Jie Zhang, Zhongqi Wang, Songkai Xue, Jiahao Wang, Shiguang Shan, Xilin Chen
分类: cs.CY, cs.AI
发布日期: 2026-07-13
💡 一句话要点
提出DeepBias框架以深入探测LVLM中的社会偏见
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 社会偏见 视觉语言模型 自适应评估 生成模型 安全性评估 深度学习 模型公平性
📋 核心要点
- 现有的偏见评估方法依赖静态数据集,无法动态适应模型的真实脆弱性,导致评估结果表面化。
- DeepBias框架通过生成、演化和探测的循环,利用代理生成和重写测试数据,深入探测模型的社会偏见。
- 实验结果表明,DeepBias在评估深度偏见方面表现出色,建立了新的基准,推动了LVLM的安全评估研究。
📝 摘要(中文)
尽管大型视觉语言模型(LVLMs)展现出卓越的能力,但它们仍然容易受到嵌入的社会偏见影响。现有的偏见评估协议主要依赖静态数据集,无法适应性地评估模型的真实脆弱性。本文提出了DeepBias,一个自适应框架,通过精心设计的代理进行LVLM中的社会偏见深入探测。该方法通过动态的“生成-演化-探测”循环操作,利用生成的ProposerAgent合成测试数据,并通过直接偏好优化(DPO)进行迭代更新,探索模型特定的失败模式。同时,DiggerAgent在多个探测回合中重写测试数据,适应性地选择来自技能库的策略。我们还构建了DeepBiasBench基准,通过五种不同的最先进LVLM作为锚点,捕捉跨架构的脆弱性。实验表明,DeepBias为深入偏见评估提供了具有挑战性的基准,建立了LVLM安全评估的演化范式。
🔬 方法详解
问题定义:本文旨在解决大型视觉语言模型(LVLMs)中嵌入的社会偏见评估问题。现有方法依赖静态数据集,无法适应性地探测模型的真实脆弱性,导致评估结果不够深入和全面。
核心思路:DeepBias框架通过动态的“生成-演化-探测”循环,利用生成的ProposerAgent和重写的DiggerAgent,逐步揭示模型的深层偏见。这样的设计使得评估过程能够根据模型的反馈不断调整,深入挖掘潜在的偏见。
技术框架:DeepBias的整体架构包括两个主要模块:ProposerAgent和DiggerAgent。ProposerAgent负责生成测试数据,并通过直接偏好优化(DPO)进行迭代更新;DiggerAgent则在多个探测回合中重写测试数据,选择适当的策略以深入探测偏见。
关键创新:DeepBias的最大创新在于其自适应的探测机制,通过动态调整测试数据和策略,能够有效揭示模型的深层偏见。这与传统静态评估方法形成鲜明对比,提供了更为全面的评估视角。
关键设计:在设计上,ProposerAgent使用DPO优化生成的测试数据,DiggerAgent则从技能库中选择重写策略。具体的参数设置和损失函数设计尚未详细说明,可能需要进一步的研究来优化这些细节。
🖼️ 关键图片
📊 实验亮点
实验结果显示,DeepBias在五种不同的最先进LVLM上表现出色,成功捕捉到跨架构的脆弱性。通过与传统静态评估方法的对比,DeepBias显著提高了偏见探测的深度和准确性,为LVLM的安全评估提供了新的基准。
🎯 应用场景
DeepBias框架具有广泛的应用潜力,尤其在社会偏见检测、模型安全性评估和公平性研究等领域。通过深入探测模型的偏见,研究人员和开发者可以更好地理解和改进模型的行为,确保其在实际应用中的安全性和公正性。未来,该框架可能推动更为全面的偏见评估标准的建立。
📄 摘要(原文)
While Large Vision-Language Models (LVLMs) demonstrate remarkable capabilities, they remain highly susceptible to embedded social biases. Existing bias evaluation protocols predominantly rely on static datasets, which provide only a superficial assessment, as their fixed test cases cannot adaptively evolve to measure the true depth and limits of model vulnerabilities. We introduce DeepBias, an adaptive framework for the in-depth probing of social biases in LVLMs with carefully designed agents. Our approach operates through a dynamic ''generation-evolution-probing'' loop. First, a generative ProposerAgent synthesizes test data and is iteratively updated via Direct Preference Optimization (DPO) based on the target LVLM's responses, exploring model-specific failure modes. Second, an autonomous skill-driven DiggerAgent rewrites each test data across multiple probing turns, adaptively selecting from a curated skill library of deepening and rewriting strategies. At each turn, this process is conditioned on the model's previous response, enabling progressively deeper biases to be exposed. Furthermore, we build a benchmark named DeepBiasBench using our framework. By employing an ensemble of five diverse state-of-the-art LVLMs as anchors, the benchmark captures vulnerabilities shared across architectures. Comprehensive experiments demonstrate the effectiveness of our framework and show that DeepBias provides a challenging benchmark for in-depth bias evaluation, establishing an evolutionary paradigm for LVLM safety assessment.