Large language models can replicate cross-cultural differences in personality
作者: Paweł Niszczota, Mateusz Janczak, Michał Misiak
分类: cs.CL, cs.AI, cs.CY
发布日期: 2023-10-12 (更新: 2025-08-18)
备注: 27 pages: 12 pages of manuscript + 15 pages of supplementary materials; in V3 added information that this is the Author Accepted Manuscript version; in V4 license changed to CC-BY
期刊: Journal of Research in Personality, 115, 104584 (2025)
DOI: 10.1016/j.jrp.2025.104584
💡 一句话要点
利用大型语言模型复制跨文化人格差异
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大型语言模型 跨文化研究 人格特质 五大人格 心理学 GPT-4 实验研究
📋 核心要点
- 现有方法在跨文化人格研究中缺乏有效的工具来模拟和验证人格差异。
- 本研究通过使用GPT-4模型,探索其在不同文化背景下对五大人格特质的模拟能力。
- 实验结果表明,GPT-4能够复制跨文化人格差异,但存在评分偏差和结构效度不足的问题。
📝 摘要(中文)
本研究通过一项大规模实验(N=8000),探讨GPT-4是否能够复制基于十项人格量表的五大人格特质的跨文化差异。我们选择美国与韩国作为文化对比,因先前研究表明这两个国家的人格差异显著。实验中,我们操控了模拟目标(美国与韩国)、量表语言(英语与韩语)及语言模型(GPT-4与GPT-3.5)。结果显示,GPT-4成功复制了各人格特质的跨文化差异,但其均值评分存在上偏差且变异性低于人类样本,结构效度也较低。我们提供了初步证据,表明大型语言模型可以为跨文化研究者和从业者提供帮助。
🔬 方法详解
问题定义:本研究旨在解决现有跨文化人格研究中缺乏有效模拟工具的问题,尤其是在不同文化背景下的人格特质评估。现有方法往往依赖于人类样本,难以进行大规模比较。
核心思路:论文的核心思路是利用大型语言模型(如GPT-4)来模拟和评估不同文化背景下的人格特质,从而提供一种新的研究工具。通过对比不同文化的模拟结果,研究者可以更好地理解跨文化人格差异。
技术框架:整体架构包括三个主要模块:1) 文化目标的选择(美国与韩国),2) 量表语言的操控(英语与韩语),3) 语言模型的应用(GPT-4与GPT-3.5)。通过这些模块的组合,研究者能够系统地评估模型的表现。
关键创新:本研究的关键创新在于首次将大型语言模型应用于跨文化人格差异的模拟,展示了其在这一领域的潜力。与传统方法相比,模型能够在更大规模上进行人格特质的评估。
关键设计:在实验设计中,采用了十项人格量表来评估五大人格特质,并通过操控语言和文化背景来验证模型的表现。模型的参数设置和损失函数设计旨在优化其在不同文化背景下的表现。实验结果显示,GPT-4的评分存在上偏差,且变异性低于人类样本。
📊 实验亮点
实验结果显示,GPT-4成功复制了五大人格特质的跨文化差异,尽管其均值评分存在上偏差,且变异性低于人类样本。与GPT-3.5相比,GPT-4在模拟跨文化人格特质方面表现出更强的能力,提供了有价值的初步证据,表明大型语言模型在跨文化研究中的应用潜力。
🎯 应用场景
该研究的潜在应用领域包括心理学、跨文化研究和人力资源管理等。通过利用大型语言模型,研究者和从业者可以更高效地评估和理解不同文化背景下的人格特质,从而在国际化团队管理和文化适应性培训中发挥重要作用。未来,随着模型的不断优化,其在跨文化研究中的应用价值将进一步提升。
📄 摘要(原文)
We use a large-scale experiment (N=8000) to determine whether GPT-4 can replicate cross-cultural differences in the Big Five, measured using the Ten-Item Personality Inventory. We used the US and South Korea as the cultural pair, given that prior research suggests substantial personality differences between people from these two countries. We manipulated the target of the simulation (US vs. Korean), the language of the inventory (English vs. Korean), and the language model (GPT-4 vs. GPT-3.5). Our results show that GPT-4 replicated the cross-cultural differences for each factor. However, mean ratings had an upward bias and exhibited lower variation than in the human samples, as well as lower structural validity. We provide preliminary evidence that LLMs can aid cross-cultural researchers and practitioners.