AuAu: A Benchmark for Auditing Authoritarian Alignment in Large Language Models

📄 arXiv: 2606.16127 📥 PDF

作者: Andreas Einwiller, Max Klabunde, Florian Lemmerich

分类: cs.CL, cs.AI, cs.LG

发布日期: 2026-07-20


💡 一句话要点

提出AuAu基准以审计大型语言模型中的威权主义倾向

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 威权主义 大型语言模型 心理测量 情景描述 用户提示 AI伦理 系统审计

📋 核心要点

  1. 当前大型语言模型在日常生活中的应用日益广泛,但其可能表现的威权主义倾向尚未得到充分审查。
  2. 本文提出AuAu基准,通过结合心理测量、情景描述和用户提示响应三种方法,系统评估LLM的威权主义倾向。
  3. 实验结果显示,尽管在心理测量工具中发现了显著的威权响应率,但在更现实的任务中,响应率显著降低,提示了模型的脆弱性。

📝 摘要(中文)

随着全球威权主义的上升和大型语言模型(LLMs)在用户日常生活中日益重要的角色,本文探讨了特定模型是否表现或促进威权主义态度。我们引入了AuAu,一个综合基准,用于评估LLM响应中的威权主义倾向风险。AuAu结合了三种评估方法:来自15个经过人类验证的心理测量工具的心理测量问题、探讨具体情境中意图行为的情景描述,以及对现实用户提示的响应。与以往研究不同,AuAu不仅测量整体威权主义对齐,还测量其已建立的子概念:威权攻击、威权服从和传统主义。对来自中国、欧盟、俄罗斯和美国的17个模型进行评估,发现所有模型在心理测量工具上的威权响应率显著,但在更现实的下游任务中,响应率显著下降。此外,一个简单的威权系统提示使17个模型中的15个模型促进了更高的威权主义。我们的结果强调了对基于LLM的AI系统进行持续、系统审计的必要性,以检测和减轻其输出中的威权倾向。

🔬 方法详解

问题定义:本文旨在解决大型语言模型中潜在的威权主义倾向评估问题。现有方法未能全面审查模型在不同情境下的威权主义表现,缺乏系统性和多样性。

核心思路:AuAu基准通过整合心理测量、情景描述和用户提示响应,提供了一个全面的评估框架,以捕捉模型的威权主义倾向及其子概念。

技术框架:AuAu的评估流程包括三个主要模块:首先,使用15个心理测量工具进行初步评估;其次,通过情景描述探讨模型在特定情境下的行为;最后,分析模型对现实用户提示的响应。

关键创新:AuAu的创新在于其综合性评估方法,不仅关注整体威权主义对齐,还细分为威权攻击、威权服从和传统主义等子概念,这在以往研究中较为罕见。

关键设计:在实验中,模型的响应通过设置特定的系统提示进行操控,以观察其对威权主义倾向的影响。实验设计中,心理测量工具的选择和情景描述的构建均经过严格验证,以确保评估的有效性和可靠性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,在心理测量工具中,所有17个模型的威权响应率显著,但在更现实的下游任务中,响应率下降。特别是,简单的威权系统提示使15个模型表现出更高的威权主义倾向,强调了模型的脆弱性和审计的必要性。

🎯 应用场景

该研究的潜在应用领域包括AI伦理审计、政策制定和社会科学研究。通过系统评估大型语言模型的威权主义倾向,能够为开发更为公正和透明的AI系统提供重要依据,促进社会对话与理解。

📄 摘要(原文)

The worldwide rise of authoritarianism and the growing role of Large Language Models (LLMs) in users' everyday lives raise the question of whether specific models exhibit or promote authoritarian attitudes. We introduce AuAu, a comprehensive benchmark for assessing the risk of authoritarian tendencies in LLM responses. AuAu combines three evaluation approaches: (i) psychometric questions from 15 human-validated instruments, (ii) vignettes probing intended behavior in concrete situations, and (iii) responses to realistic user prompts. Unlike prior work, AuAu measures not only overall authoritarian alignment but also its established sub-concepts: Authoritarian Aggression, Authoritarian Submission, and Conventionalism. Evaluating 17 models from China, the EU, Russia, and the USA, we find substantial authoritarian response rates on psychometric instruments across all models, though rates drop significantly on more realistic downstream tasks. Moreover, a simple authoritarian system prompt manipulates 15 of 17 models into promoting increased authoritarianism. Our results underscore the need for continued, systematic auditing of LLM-based AI systems to detect and mitigate authoritarian tendencies in their outputs.