Which Values Do LLMs Confuse? A Schwartz-Based Recognition Study

📄 arXiv: 2607.20270v1 📥 PDF

作者: Andrei Chetvergov, Stepan Ukolov, Timofei Sivoraksha, Alexander Evseev, Mikhail Solovev, Valeriia Kuschenko, Maria Chistyakova, Sergey Bolovtsov

分类: cs.CL

发布日期: 2026-07-22

备注: 14 pages, 7 figures, 3 tables


💡 一句话要点

提出基于施瓦茨价值观的识别研究以评估大型语言模型的价值混淆

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 价值观识别 施瓦茨价值观 语义分析 人机交互 心理学 道德决策

📋 核心要点

  1. 现有方法在评估大型语言模型的价值观时,假设模型能够准确识别具体情境中的价值,但实际表现不佳。
  2. 本文通过施瓦茨的十种基本价值观进行控制的top-1识别,提出了一种新的评估方法,旨在提高模型的价值识别能力。
  3. 实验结果显示,21个LLM的Acc@1为0.683,Acc@3为0.892,表明模型在识别动机区域上表现良好,但存在显著的相邻价值混淆问题。

📝 摘要(中文)

大型语言模型(LLMs)越来越多地通过其所支持的价值观进行评估,但这种评估假设模型能够识别具体情境中表达的价值。本文研究了这一前提,采用施瓦茨的十种基本价值观进行控制的top-1识别。评估集包含1000个平衡的俄语情境文本,涵盖十种价值观,并由两名人工标注者独立标注。我们在固定的排名响应协议下评估了21个经过指令调优的LLM运行,20个输出可靠的运行形成语义面板。结果显示,模型在定位正确的动机区域时表现良好,但在接近的替代品排名上不稳定。相邻价值观占语义错误的50.9%。八种定向混淆在不同检查点和人类确认的子集中反复出现,且其严重性具有检查点特异性,可能会影响更高阶的价值轮廓。

🔬 方法详解

问题定义:本文旨在解决大型语言模型在具体情境中识别价值观的能力不足,现有方法未能有效捕捉模型的价值识别准确性和稳定性。

核心思路:通过施瓦茨的十种基本价值观进行控制的top-1识别,结合准确性、排名恢复和定向错误分析,全面评估模型的价值识别能力。

技术框架:整体架构包括数据收集、标注、模型训练和评估四个主要模块。数据集由1000个俄语情境文本组成,经过两名标注者独立标注,确保数据的可靠性。

关键创新:本研究的创新点在于系统性地分析了模型在价值识别中的混淆模式,尤其是相邻价值观的混淆,提供了新的评估视角。

关键设计:在实验中,采用固定的排名响应协议,评估21个指令调优的LLM运行,使用Acc@1和Acc@3作为性能指标,确保评估的全面性和准确性。实验还揭示了不同检查点之间的混淆模式差异。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,21个LLM的Acc@1为0.683,Acc@3为0.892,表明模型在定位正确的动机区域时表现良好。相邻价值观的混淆占语义错误的50.9%,揭示了模型在价值识别中的不稳定性和特定混淆模式。

🎯 应用场景

该研究的潜在应用领域包括社会科学、心理学和人机交互等,能够帮助开发更具人性化的AI系统,提升其在道德和伦理决策中的表现。未来,该方法可以扩展到其他文化背景下的价值观识别,促进跨文化的理解与交流。

📄 摘要(原文)

Large language models are increasingly evaluated through the values they endorse, but such evaluations presuppose that models can identify the value expressed in a concrete situation. We study this prerequisite as controlled top-1 recognition over Schwartz's ten basic values. Our evaluation set contains 1,000 Russian situational texts, balanced across the ten values and independently labeled by two human annotators per item. We evaluate 21 instruction-tuned LLM runs under a fixed ranked-response protocol; 20 runs with reliable outputs form the semantic panel. Pooled Acc@1 is 0.683 and Acc@3 is 0.892, showing that models often locate the correct motivational region while ranking close alternatives unstably. Adjacent values account for 50.9% of semantic errors, compared with 24.4% under a checkpoint-specific null. Eight directed confusions recur across checkpoints and human-confirmed subsets. Several are strongly asymmetric, including Universalism to Benevolence, Tradition to Conformity, and Security to Power, whereas Stimulation-Hedonism forms a bidirectional boundary. Their severity is checkpoint-specific and can bias higher-order value profiles. The results motivate value-recognition evaluation that combines exact accuracy, ranked recovery, and directed error analysis.