Pancasila-Dilemmas: Evaluating Large Language Models on Indonesian Human Value Dilemmas Grounded in Pancasila
作者: Supryadi, Irfan, Julianti, Darren Keanly Martin, Jayvin Fernando, Yuqi Ren, Deyi Xiong
分类: cs.CL
发布日期: 2026-07-20
🔗 代码/项目: GITHUB
💡 一句话要点
提出Pancasila-Dilemmas评估数据集以解决印尼价值观对齐问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 价值对齐 大规模语言模型 印尼文化 Pancasila 伦理评估 数据集构建 人工智能
📋 核心要点
- 现有的价值对齐评估主要集中在西方或普遍价值,缺乏针对特定国家的评估,尤其是印尼的价值观。
- 本文提出Pancasila-Dilemmas数据集,通过1,834个问题反映印尼的五个核心价值,旨在评估LLMs的价值对齐。
- 评估结果显示,所有LLMs在PMS和MVAS上均表现不佳,尤其在宗教和团结方面,揭示了对印尼价值观的捕捉不足。
📝 摘要(中文)
大规模语言模型(LLMs)的价值对齐对于确保其响应符合人类意图和价值偏好至关重要。然而,现有的价值对齐评估大多集中于西方或普遍价值,缺乏基于特定国家价值体系的评估。本文介绍了Pancasila-Dilemmas,这是一个包含1,834个问题的评估数据集,源自印尼新闻,按五个Pancasila价值分类:宗教、人性、团结、民主和社会正义。该数据集反映了印尼的日常生活,适合用于衡量在印尼部署的LLMs的价值对齐。我们对50个闭源和开源LLMs进行了评估,结果显示所有评估的LLMs的概率匹配分数(PMS)均低于0.5,最大投票一致性分数(MVAS)为0.72,尤其在宗教和团结的困境案例中表现不佳,显示出捕捉印尼价值观的显著差距。
🔬 方法详解
问题定义:本文旨在解决大规模语言模型在印尼特定价值观对齐方面的不足,现有方法多集中于西方价值,缺乏针对印尼文化的评估数据集。
核心思路:通过构建Pancasila-Dilemmas数据集,包含与印尼日常生活相关的价值困境问题,来评估LLMs的价值对齐能力。
技术框架:数据集由1,834个问题组成,涵盖宗教、人性、团结、民主和社会正义五个价值,问题由母语者校对,并由五位不同背景的印尼公民回答。评估包括50个闭源和开源LLMs。
关键创新:Pancasila-Dilemmas数据集是首个专注于印尼价值观的评估工具,填补了现有评估中对特定文化价值的忽视,提供了更具针对性的评估标准。
关键设计:数据集中的问题经过严格筛选,确保其反映印尼社会的真实困境,评估指标包括概率匹配分数(PMS)和最大投票一致性分数(MVAS),以量化模型的价值对齐能力。
🖼️ 关键图片
📊 实验亮点
实验结果显示,所有评估的LLMs在PMS上均低于0.5,MVAS为0.72,尤其在宗教和团结的困境案例中表现不佳。这表明当前LLMs在捕捉印尼特定价值观方面存在显著不足,亟需改进。
🎯 应用场景
该研究的潜在应用领域包括教育、社会科学研究和人工智能伦理等。通过提供针对印尼文化的评估工具,研究可以帮助开发更符合当地价值观的AI系统,促进人机交互的和谐与有效性。
📄 摘要(原文)
The value alignment of large language models (LLMs) is crucial for ensuring responses align with human intention and value preferences. However, most evaluations of value alignment focus on Western or universal values, while assessments grounded in the value systems of specific countries remain scarce. In this paper, we introduce Pancasila-Dilemmas, an evaluation dataset of 1,834 questions derived from Indonesian news, classified by 5 values of Pancasila: Religion, Humanity, Unity, Democracy, and Social Justice. This dataset reflects daily life in Indonesia, making it suitable for measuring the value alignment of LLMs deployed for Indonesia. To ensure a more rigorous evaluation, we choose scenarios containing dilemmas. The dataset is proofread by native speakers and answered by 5 diverse Indonesian citizens. We evaluate 50 closed- and open-source LLMs on our dataset. Results reveal that all evaluated LLMs achieves less than 0.5 Probability Match Score (PMS) and 0.72 Max-Vote Agreement Score (MVAS). Compared by each values, LLMs mostly struggle in Religion and Unity dilemma cases. This highlights a significant gap in capturing Indonesian values. The dataset is publicly available at https://github.com/tjunlp-lab/Pancasila-Dilemmas.