PLURAL: A Global Dataset for Value Alignment

📄 arXiv: 2607.08034v1 📥 PDF

作者: Dhruv Agarwal, Anya Shukla, Tanya Goyal, Aditya Vashistha

分类: cs.CL, cs.AI, cs.CY

发布日期: 2026-07-09

🔗 代码/项目: HUGGINGFACE


💡 一句话要点

提出PLURAL数据集以解决语言模型价值对齐问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 价值对齐 大型语言模型 多元文化 合成数据集 跨文化研究 偏好三元组 人工智能伦理

📋 核心要点

  1. 现有大型语言模型往往反映西方价值观,缺乏对多元文化和价值观的有效表示,导致其在全球应用中的局限性。
  2. PLURAL数据集通过将综合价值调查的响应转化为合成偏好三元组,旨在保留不同国家和文化的价值信号,增强模型的价值对齐能力。
  3. 实验结果显示,使用PLURAL训练的模型在文化特征对齐上表现优异,平均绝对误差相较于强基线降低了27.7%,并在盲评中获得更高的国家价值代表性评分。

📝 摘要(中文)

大型语言模型(LLMs)在全球广泛使用,但往往偏向西方价值观,限制了其对多元价值体系的代表能力。本文介绍了PLURAL,一个基于综合价值调查(IVS)的价值导向偏好数据集,涵盖92个国家。通过两阶段生成管道,我们将调查响应转化为合成偏好三元组,保留规范价值信号并生成现实场景。初步版本包含约500,000个偏好三元组,代表20个多样化国家。我们通过三种方式评估PLURAL,结果表明其在价值引导方面具有可学习信号,为多元对齐提供了可扩展资源。

🔬 方法详解

问题定义:本文旨在解决大型语言模型在价值对齐方面的不足,尤其是其对多元文化价值的缺乏表示,导致模型在不同国家和文化背景下的应用效果不佳。

核心思路:PLURAL数据集通过将来自92个国家的综合价值调查结果转化为合成偏好三元组,旨在保留和反映不同文化的价值观,从而增强模型的多元对齐能力。

技术框架:整体架构包括两个主要阶段:第一阶段是从综合价值调查中提取数据,第二阶段是生成合成偏好三元组,确保生成的场景既真实又能反映规范价值信号。

关键创新:PLURAL的创新在于其大规模生成的合成偏好三元组,能够有效捕捉和表示不同国家的文化价值,与现有数据集相比,提供了更为丰富和多样的价值信号。

关键设计:在生成过程中,采用了特定的参数设置和损失函数,以确保生成的偏好三元组在保持文化多样性的同时,能够真实反映调查数据中的价值观差异。

🖼️ 关键图片

img_0
img_1

📊 实验亮点

实验结果显示,使用PLURAL训练的模型在文化特征对齐上显著提升,平均绝对误差降低了27.7%,并且在盲评中,176名评估者认为PLURAL对齐的响应更能代表其国家价值观,验证了数据集的有效性和实用性。

🎯 应用场景

PLURAL数据集的潜在应用领域包括跨文化的人工智能系统、个性化推荐系统以及社会科学研究。通过增强模型对多元价值观的理解,PLURAL能够促进更具包容性的AI应用,推动全球范围内的文化交流与理解。

📄 摘要(原文)

Large language models (LLMs) are used worldwide, yet disproportionately reflect Western values, limiting their ability to represent diverse value systems. We introduce PLURAL, a large-scale, value-focused preference dataset grounded in the Integrated Values Survey (IVS), a nationally representative survey spanning 92 countries. Using a two-stage generation pipeline, we transform survey responses into synthetic preference triplets that preserve normative value signals while producing realistic scenarios. We release an initial version of PLURAL containing ~500,000 preference triplets representing people in 20 diverse countries. We evaluate PLURAL in three ways: (i) dataset-level validation showing that it preserves both cross-country value differences and within-country diversity from the original survey; (ii) automated evaluation showing that training on PLURAL improves alignment with target countries' cultural profiles, reducing mean absolute error by up to 27.7% relative to strong baselines; and (iii) blind human evaluation with 176 evaluators in India, Brazil, and Japan, who judge PLURAL-aligned responses as more representative of their national values. Together, these results show that PLURAL contains learnable signal for value steering, offering a scalable resource for pluralistic alignment. Dataset: https://huggingface.co/datasets/agdhruv/plural-alignment