Pluralis v0.1: Towards a Multicultural, Multimodal, Multilingual Benchmark for AI Risk and Reliability

📄 arXiv: 2607.06196v1 📥 PDF

作者: Alicia Parrish, Rajat Shinde, Sanket Badhe, Xinyi Bai, Sree Bhargavi Balija, Hua-Rong Chu, Emilio Ferrara, Armstrong Foundjem, Rajat Ghosh, Aakash Gupta, Xuanli He, Ong Chen Hui, Minji Jung, Madhangi Karimanal, Faiza Khan Khattak, Boryoung Kim, Eugenia Kim, Liliya Lavitas, Seok Min Lim, Victor Lu, Jim Moirangthem, Dhivya Nagasubramanian, Deepak Pandita, Sita Rajagopal, Geetha Raju, Evgeniia Razumovskaia, Aravind Reddy, Federico Ricciuti, Nobin Sarwar, Sungpil Shin, Sunayana Sitaram, Snehal Thorat, Tharindu Cyril Weerasooriya, Jasmijn Bastings, Joachim Baumann, Kongtao Chen, Murali Emani, Mariya Hendriksen, Jiho Jin, Jun Seong Kim, Younghoon Ko, Alicja Kwasniewska, Minjae Lee, Tom Wei-cyuan Lin Kashyap Ramanandula Manjusha, Junho Myung, Junyeong Park, Roma Patel, Shyam Ratan, Sudarsun Santhiappan, Priyanka Suresh, Tuesday, Ksheeraj Sai Vepuri Laura Amortegui-Ordonez, Claire Dennis, Minsuk Kahng, Chris Knotz, Alice Oh, Balaraman Ravindran, Soojung Ryu William Bartholomew, Hiwot Tesfaye, Lora Aroyo

分类: cs.CL, cs.CY

发布日期: 2026-07-07


💡 一句话要点

提出Pluralis v0.1以解决AI安全评估中的文化偏见问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: AI安全评估 多模态数据集 文化适应性 视觉语言模型 多语言评估 区域法律 社会语言学 文化优先

📋 核心要点

  1. 现有的AI安全评估框架多依赖西方文化的默认设置,导致在全球应用中存在文化适应性不足的问题。
  2. Pluralis v0.1通过本地化数据集和多模态评估方法,提供了一种新的文化优先视角,解决了传统方法的局限性。
  3. 实验结果显示,Pluralis能够有效识别不同地区和语言的特定失败模式,揭示了全球平均指标所隐藏的盲点。

📝 摘要(中文)

当前的AI安全评估和基准框架主要依赖西方文化的默认设置,忽视了区域法律、社会语言学细微差别和文化禁忌,使得视觉语言模型在全球部署中面临风险。本文介绍了Pluralis v0.1,这是一个从文化优先视角构建的多模态、多区域和多语言数据集,涵盖六个亚太国家(孟加拉国、印度、韩国、巴基斯坦、新加坡、台湾)和八种语言,共6448个提示。Pluralis通过本地化安全隐患的原生采集,建立了多模态评估范式,揭示了普遍安全违规与本地文化适宜性之间的区别。最终,Pluralis旨在为未来的多语言、多文化评估研究奠定基础。

🔬 方法详解

问题定义:本文旨在解决现有AI安全评估框架的文化偏见问题,现有方法往往忽视区域特有的法律和文化背景,导致视觉语言模型在全球部署中存在风险。

核心思路:Pluralis v0.1通过构建一个多模态、多区域和多语言的数据集,从文化优先的视角出发,原生采集本地化的安全隐患,而非简单适配西方数据集。

技术框架:整体架构包括数据集的构建、用户文本与图像的多模态评估、以及Judge-Pluralis模型的训练。数据集涵盖6448个提示,涉及六个国家和八种语言,评估过程中结合用户文本与图像的语义关系。

关键创新:最重要的技术创新在于引入了多模态评估范式,明确区分普遍安全违规与本地文化适宜性,将后者作为评估的重要维度。

关键设计:在Judge-Pluralis模型中,采用了基于经验导出的文化分类法进行训练,确保模型能够识别和评估不同文化背景下的安全隐患。

🖼️ 关键图片

img_0
img_1

📊 实验亮点

实验结果表明,Pluralis能够有效识别不同地区的特定失败模式,例如图像误识别和上下文遗漏。这些失败模式在不同语言和地区中表现出系统性的差异,揭示了全球平均指标所掩盖的盲点,为未来的研究提供了重要的参考。

🎯 应用场景

该研究的潜在应用领域包括全球范围内的AI系统设计与评估,尤其是在多文化和多语言环境中。通过提供一个文化优先的数据集,Pluralis v0.1能够帮助开发者更好地理解和应对不同地区的文化差异,从而提高AI系统的安全性和可靠性。

📄 摘要(原文)

Current AI safety evaluation and benchmarking frameworks predominantly rely on Western-centric culture-agnostic defaults that mask critical regional laws, socio-linguistic nuances, and cultural taboos, leaving Vision-Language Models (VLMs) vulnerable in global deployments. We introduce Pluralis v0.1: a novel multimodal, multi-regional, and multilingual dataset built from a culture-first perspective. Spanning 6,448 prompts across six Asia-Pacific countries (Bangladesh, India, Korea, Pakistan, Singapore, Taiwan) and eight languages, Pluralis diverges from prior work by natively sourcing localized safety hazards rather than adapting Western datasets. Crucially, it introduces a multimodal evaluation paradigm: user text (e.g., "Should I gift this?") and an image referring to "this" (e.g., a clock) - both innocuous in isolation, but synergistically triggering specific legal or cultural violations. Pluralis disentangles universal safety violations from localized cultural appropriateness, establishing the latter as a first-class evaluation axis. To operationalize this, we present Judge-Pluralis, an agreement-gated LLM-as-a-Judge ensemble trained on examples classified in an empirically derived cultural taxonomy. Observing VLM behavior on a subset of the Pluralis surfaces recurring, locale-specific failure modes such as image misidentifications with downstream harm, missed item-context-locale interactions, and inadequate refusals. These failure modes vary systematically across locales and languages, exposing blind spots that globally averaged metrics conceal. Ultimately, Pluralis is not presented as a solved evaluation framework for cultural alignment, but rather as a first step and catalyst for future innovation. We call upon the research community to utilize this foundation to advance the science of multilingual, multicultural evaluation to better support AI cultural alignment globally.