It Takes One to Bias Them All: Breaking Bad with One-Shot GRPO

📄 arXiv: 2606.10931 📥 PDF

作者: Naihao Deng, Yilun Zhu, Naichen Shi, Clayton Scott, Rada Mihalcea

分类: cs.CL

发布日期: 2026-07-20


💡 一句话要点

提出单例GRPO以揭示大语言模型的偏见脆弱性

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 偏见检测 群体相对策略优化 模型对齐 自然语言处理

📋 核心要点

  1. 核心问题:现有的大型语言模型在后训练过程中容易受到单一偏见示例的影响,导致系统性偏见的产生。
  2. 方法要点:本文提出了一种单例GRPO方法,通过在单个偏见示例上进行训练,探讨其对模型输出的影响。
  3. 实验或效果:研究结果表明,模型的偏见输出与其初始生成偏见的可能性相关,揭示了后训练的脆弱性。

📝 摘要(中文)

警告:本文包含多处有毒和冒犯性言论。现代大型语言模型(LLMs)通常通过大规模后训练进行对齐,以确保其公平和可靠的行为。本文研究了如何通过群体相对策略优化(GRPO)轻易打破这些保护措施。我们展示了在单个偏见示例上进行的一次性GRPO训练足以引发系统性偏见,且基于刻板印象的推理在属性、类别和基准之间具有广泛的泛化能力。我们进一步发现,模型在产生偏见输出的初始可能性上存在差异,这揭示了后训练中的关键脆弱性:对齐可以被单个示例覆盖。

🔬 方法详解

问题定义:本文旨在解决大型语言模型在后训练过程中对单一偏见示例的脆弱性,现有方法未能有效防止这种偏见的产生。

核心思路:论文提出通过一次性GRPO训练,利用单个偏见示例来诱导模型产生系统性偏见,揭示了模型在对齐过程中的潜在缺陷。

技术框架:整体架构包括数据准备、一次性GRPO训练和模型评估三个主要阶段。数据准备阶段收集偏见示例,训练阶段应用GRPO算法,评估阶段则分析模型输出的偏见程度。

关键创新:最重要的技术创新在于展示了单个示例如何足以覆盖模型的对齐机制,与现有方法相比,强调了模型在偏见生成上的脆弱性。

关键设计:在参数设置上,选择了特定的损失函数以强化偏见输出的生成,同时设计了适应性网络结构以提高模型对偏见示例的敏感性。

📊 实验亮点

实验结果显示,单次GRPO训练在偏见示例上的应用,显著提高了模型输出的偏见程度。与基线模型相比,偏见输出的生成概率在特定类别上提升了超过30%,揭示了模型在对齐过程中的关键脆弱性。

🎯 应用场景

该研究的潜在应用领域包括自然语言处理、社交媒体内容审核和人工智能伦理等。通过揭示模型的偏见脆弱性,研究为改进模型的公平性和可靠性提供了重要的理论基础,未来可能影响模型的设计和训练策略。

📄 摘要(原文)

Warning: This paper contains several toxic and offensive statements. Modern large language models (LLMs) are typically aligned through large-scale post-training to ensure fair and reliable behavior. In this work, we investigate how easily such guardrails can be broken by Group Relative Policy Optimization (GRPO). We show that one-shot GRPO training on a single biased example is sufficient to induce systematic bias, with stereotype-driven reasoning generalizing across attributes, categories, and benchmarks. We further find that models differ in their susceptibility based on the initial likelihood of producing biased outputs. Our results reveal a critical vulnerability in post-training: alignment can be overridden by a single example.