Same Values, Different Languages? From Multilingual Probing to Steering LLMs Toward Chinese Social Values
作者: Yuemei Xu, Kexin Xu, Jian Zhou, Haoyu Lu, Yequan Wang, Aishan Liu
分类: cs.CL, cs.AI
发布日期: 2026-09-08
💡 一句话要点
提出C-Voices数据集与价值向量引导方法以解决多语言价值对齐问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大型语言模型 多语言对齐 社会价值观 价值向量引导 跨文化研究
📋 核心要点
- 现有方法未能充分探讨大型语言模型在不同语言中对文化根植的价值观的表现,尤其是中国社会价值观。
- 提出C-Voices数据集和无微调的价值向量引导方法,通过隐藏状态差异推导价值方向,干预价值敏感层。
- 实验结果显示,CSV导向的偏好因模型和语言而异,同一困境在不同语言中产生不同反应,验证了方法的有效性。
📝 摘要(中文)
随着大型语言模型(LLMs)日益融入人类社会,使其与多元社会价值观保持一致已成为重要任务。然而,LLMs在不同语言中是否展现出一致的价值偏好尚未得到充分研究,尤其是文化根植的价值观。本文通过构建C-Voices数据集,探讨了中国社会价值观(CSV)在六种语言中的表现,并提出了一种无需微调的价值向量引导方法。实验表明,CSV导向的偏好依赖于模型和语言,同一困境在不同语言中引发的反应存在差异。该方法有效地实现了CSV引导,并支持价值向量的跨语言迁移。
🔬 方法详解
问题定义:本文旨在解决大型语言模型在多语言环境中对中国社会价值观的对齐问题。现有方法未能有效评估和对齐文化根植的价值观,尤其是在不同语言间的表现差异。
核心思路:论文提出了一种无微调的价值向量引导方法,通过分析隐藏状态的差异来推导价值方向,并在推理过程中选择性地干预价值敏感层,以实现对CSV的有效引导。
技术框架:整体架构包括C-Voices数据集的构建、价值向量的推导和干预机制。首先构建包含86400个困境实例的多语言对比探测数据集,然后基于隐藏状态差异推导价值向量,最后在推理时进行干预。
关键创新:最重要的技术创新在于提出了无微调的价值向量引导方法,能够在不改变模型参数的情况下,实现对价值观的有效引导。这与传统的微调方法形成鲜明对比,避免了对模型的全面重训练。
关键设计:在设计中,关键参数包括选择的价值敏感层和干预策略,损失函数则侧重于最大化价值向量与目标CSV的相似度,同时保持模型的原始性能。
🖼️ 关键图片
📊 实验亮点
实验结果表明,所提出的方法在六种语言中实现了有效的CSV引导,支持价值向量的跨语言迁移。具体而言,同一困境在不同语言中引发的反应存在显著差异,验证了模型对语言敏感性的影响,且方法在多语言环境中的表现优于现有基线。
🎯 应用场景
该研究的潜在应用领域包括多语言聊天机器人、跨文化内容生成和社会价值观引导的人工智能系统。通过对大型语言模型进行价值观的有效引导,可以提升其在多元文化环境中的适应性和社会责任感,促进更和谐的人机交互。
📄 摘要(原文)
As Large Language Models (LLMs) are increasingly integrated into human society, aligning them with pluralistic social values has become a critical priority. However, whether LLMs exhibit consistent value preferences across languages remains underexplored, particularly for culturally grounded values, which are more abstract and difficult to evaluate and align than safety-centric principles. We investigate this issue through Chinese Social Values (CSV), a value system rooted in Chinese culture and comprising $12$ dimensions across national, societal, and personal levels. We construct C-Voices, the first comprehensive multilingual contrastive probe dataset for CSV, with 86,400 dilemma-based instances in six languages, each pairing a CSV-aligned action with a value-conflicting alternative. Building on the contrastive probes of C-Voices, we then propose a fine-tuning-free value vector steering method that derives value directions from hidden-state discrepancies and selectively intervenes on value-sensitive layers during inference. Experiments on six languages show that CSV-oriented preferences are model-dependent and language-sensitive, with the same dilemma eliciting divergent responses across languages. Our method achieves effective CSV steering, supports cross-lingual transfer of value vectors, and generalizes to existing FLAMES and ValuePrism.