All Languages Matter: On the Multilingual Safety of Large Language Models
作者: Wenxuan Wang, Zhaopeng Tu, Chang Chen, Youliang Yuan, Jen-tse Huang, Wenxiang Jiao, Michael R. Lyu
分类: cs.CL, cs.AI
发布日期: 2023-10-02 (更新: 2024-06-20)
备注: Accepted by ACL 2024 Findings. The first multilingual safety benchmark for large language models
🔗 代码/项目: GITHUB
💡 一句话要点
提出XSafety基准以解决多语言大语言模型安全性问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多语言模型 安全性评估 大型语言模型 XSafety基准 跨语言对齐
📋 核心要点
- 现有的安全基准主要集中在单一语言,忽视了多语言环境下的安全性问题,导致非英语用户面临更高的风险。
- 本文提出XSafety基准,涵盖多种语言和安全问题,并通过实证研究分析了多种LLMs的安全性表现。
- 实验结果显示,所有LLMs在处理非英语查询时产生的安全性问题显著高于英语查询,提示需要改进非英语的安全对齐策略。
📝 摘要(中文)
安全性是开发和部署大型语言模型(LLMs)的核心。然而,现有的安全基准主要关注单一语言的安全性,尤其是预训练数据中的主要语言如英语。本文构建了第一个多语言安全基准XSafety,涵盖10种语言中的14种常见安全问题。通过XSafety,我们对4种广泛使用的LLMs进行了实证研究,发现这些模型在非英语查询中产生的安全性问题显著高于英语查询,表明需要为非英语语言开发安全对齐。此外,我们提出了几种简单有效的提示方法,以提高ChatGPT的多语言安全性,显著降低非英语查询的安全性响应比例,从19.1%降至9.7%。
🔬 方法详解
问题定义:本文旨在解决现有大型语言模型在多语言环境下的安全性不足问题。现有方法主要关注英语,导致非英语语言的安全性评估缺失。
核心思路:通过构建XSafety基准,涵盖多种语言和安全问题,进行系统的多语言安全性评估,并提出有效的提示方法来改善安全性。
技术框架:XSafety基准包括14种安全问题,覆盖10种语言。实验中对4种流行的LLMs进行评估,分析其在不同语言下的安全性表现。
关键创新:XSafety是首个多语言安全基准,填补了现有研究在多语言安全性评估上的空白,强调了非英语语言的安全性问题。
关键设计:在提示方法中,设计了多种策略以激发安全知识,增强跨语言的安全对齐效果,显著降低了非英语查询的安全性响应比例。具体实验中,非英语查询的安全性响应比例从19.1%降至9.7%。
🖼️ 关键图片
📊 实验亮点
实验结果表明,所有评估的LLMs在处理非英语查询时产生的安全性问题显著高于英语查询,安全性响应比例从19.1%降低至9.7%。这一结果强调了为非英语语言开发安全对齐的重要性。
🎯 应用场景
该研究的潜在应用领域包括多语言聊天机器人、跨国企业的客户服务系统以及全球范围内的内容审核工具。通过提高多语言环境下的安全性,能够更好地保护用户,提升用户体验,促进大语言模型的全球化应用。
📄 摘要(原文)
Safety lies at the core of developing and deploying large language models (LLMs). However, previous safety benchmarks only concern the safety in one language, e.g. the majority language in the pretraining data such as English. In this work, we build the first multilingual safety benchmark for LLMs, XSafety, in response to the global deployment of LLMs in practice. XSafety covers 14 kinds of commonly used safety issues across 10 languages that span several language families. We utilize XSafety to empirically study the multilingual safety for 4 widely-used LLMs, including both close-API and open-source models. Experimental results show that all LLMs produce significantly more unsafe responses for non-English queries than English ones, indicating the necessity of developing safety alignment for non-English languages. In addition, we propose several simple and effective prompting methods to improve the multilingual safety of ChatGPT by evoking safety knowledge and improving cross-lingual generalization of safety alignment. Our prompting method can significantly reduce the ratio of unsafe responses from 19.1% to 9.7% for non-English queries. We release our data at https://github.com/Jarviswang94/Multilingual_safety_benchmark.