Generative Language Models Exhibit Social Identity Biases

📄 arXiv: 2310.15819v2 📥 PDF

作者: Tiancheng Hu, Yara Kyrychenko, Steve Rathje, Nigel Collier, Sander van der Linden, Jon Roozenbeek

分类: cs.CL, cs.CY

发布日期: 2023-10-24 (更新: 2024-06-17)

备注: supplementary material, data, and code see https://osf.io/9ht32/?view_only=f0ab4b23325f4c31ad3e12a7353b55f5


💡 一句话要点

研究揭示大型语言模型的社会身份偏见问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 社会身份偏见 大型语言模型 自然语言处理 模型微调 数据策划 偏见减轻

📋 核心要点

  1. 现有大型语言模型可能学习到人类的社会身份偏见,导致内群体和外群体的偏见表现。
  2. 论文通过分析56个大型语言模型,提出了通过数据策划和微调来减轻偏见的解决方案。
  3. 研究结果显示,几乎所有基础模型和部分微调模型都表现出明显的社会身份偏见,且可以通过特定方法减轻。

📝 摘要(中文)

随着大型语言模型的流行,关于这些模型可能学习到的偏见引发了广泛关注。本文研究了56个大型语言模型是否存在社会心理学中已知的内群体团结和外群体敌意的基本社会身份偏见。研究发现,几乎所有基础语言模型和部分经过指令微调的模型在完成句子时表现出明显的内群体积极和外群体消极的关联。结果表明,现代语言模型在实验室和真实对话中展现出与人类相似的社会身份偏见,且通过精心策划训练数据和指令微调可以减轻这些偏见。研究结果对创建更少偏见的大型语言模型具有实际意义,并强调了进一步研究用户与大型语言模型互动的重要性,以防止潜在的偏见强化。

🔬 方法详解

问题定义:本文旨在探讨大型语言模型是否存在社会身份偏见,现有方法未能有效识别和减轻这些偏见,可能导致模型在实际应用中产生不公正的结果。

核心思路:研究通过对56个大型语言模型进行分析,探讨内群体和外群体偏见的表现,并提出通过优化训练数据和指令微调来减轻这些偏见的策略。

技术框架:研究采用实验设计,首先对模型进行句子补全任务的测试,然后分析模型输出的偏见程度,最后提出改进措施。主要模块包括模型选择、数据策划、实验设计和结果分析。

关键创新:本研究的创新点在于系统性地评估了大型语言模型的社会身份偏见,并提出了通过数据和微调策略来减轻这些偏见的方法,这在现有文献中尚属首次。

关键设计:在实验中,使用了多种句子提示来测试模型的偏见表现,并通过对比分析不同模型的输出,评估了数据策划和微调的有效性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,几乎所有基础语言模型和部分微调模型在句子补全任务中表现出明显的内群体积极和外群体消极偏见。通过数据策划和指令微调,模型的偏见程度得到了有效减轻,表明这些方法在实际应用中具有显著的改善效果。

🎯 应用场景

该研究的结果对自然语言处理领域具有重要的应用价值,尤其是在开发更公正的语言模型方面。通过识别和减轻社会身份偏见,模型可以在多种应用场景中更好地服务于不同用户群体,减少潜在的社会影响。未来,研究还可以扩展到用户与模型互动的研究,以进一步优化模型的公平性和可靠性。

📄 摘要(原文)

The surge in popularity of large language models has given rise to concerns about biases that these models could learn from humans. We investigate whether ingroup solidarity and outgroup hostility, fundamental social identity biases known from social psychology, are present in 56 large language models. We find that almost all foundational language models and some instruction fine-tuned models exhibit clear ingroup-positive and outgroup-negative associations when prompted to complete sentences (e.g., "We are..."). Our findings suggest that modern language models exhibit fundamental social identity biases to a similar degree as humans, both in the lab and in real-world conversations with LLMs, and that curating training data and instruction fine-tuning can mitigate such biases. Our results have practical implications for creating less biased large-language models and further underscore the need for more research into user interactions with LLMs to prevent potential bias reinforcement in humans.