IndicSafeEval: Safety Robustness of Large Language Models under Multilingual Persuasive Jailbreak Attacks

📄 arXiv: 2609.03781v2 📥 PDF

作者: Saikat Mondal, Mamta, Deeksha Varshney, Oana Cocarascu, Asif Ekbal

分类: cs.CL, cs.AI

发布日期: 2026-09-03 (更新: 2026-09-04)

备注: 38 pages, 7 figures, 33 tables. Accepted to Findings of EMNLP 2026. Contains examples of harmful model outputs

🔗 代码/项目: GITHUB


💡 一句话要点

提出IndicSafeEval框架以评估多语言环境下LLM的安全性

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 安全性评估 多语言处理 对抗性攻击 说服策略 印度语言 黑箱测试

📋 核心要点

  1. 现有的安全性评估主要集中在英语,导致对低资源语言的对齐失败理解不足。
  2. 提出IndicSafeEval框架,结合多种安全内容类别与说服策略,专注于印度语言的安全性评估。
  3. 实验表明,模型在不同语言和提示风格下的安全性表现差异显著,某些有害内容更易受到说服性攻击。

📝 摘要(中文)

大型语言模型(LLMs)在多语言环境中的应用日益增多,但其安全性评估主要集中在英语上,这限制了我们对低资源和文化多样性语言中对齐失败表现的理解。本文提出了IndicSafeEval,一个基于说服的监狱破解评估框架,专注于印度语言。该基准结合了十个安全关键内容类别和六种类人说服策略,涵盖四种不同的印度语言,如印地语、孟加拉语、马拉地语和旁遮普语,共生成7200个对抗性提示。通过对多个开源LLM进行系统的黑箱评估,研究发现模型在不同语言和提示风格下的安全性表现并不均衡,安全性能强烈依赖于所用语言和请求的措辞方式。不同风险类别的脆弱性也存在显著差异,这些发现揭示了当前安全评估的局限性,并强调了多语言和说服意识基准框架的必要性。

🔬 方法详解

问题定义:本文旨在解决大型语言模型在多语言环境下的安全性评估不足,尤其是对低资源语言的评估缺乏系统性。现有方法主要集中在英语,未能全面反映不同语言和文化背景下的对齐失败表现。

核心思路:提出IndicSafeEval框架,通过结合多种安全关键内容类别和说服策略,系统评估印度语言的安全性表现。该框架旨在揭示不同语言和提示风格下模型的安全性差异。

技术框架:IndicSafeEval框架包括数据生成模块、评估模块和分析模块。数据生成模块创建7200个对抗性提示,评估模块对多个开源LLM进行黑箱测试,分析模块则对结果进行深入分析。

关键创新:最重要的创新在于引入了多语言和说服性评估的视角,填补了现有安全评估的空白。通过系统化的框架,能够更全面地理解模型在不同文化背景下的安全性表现。

关键设计:在参数设置上,框架结合了十个安全内容类别和六种说服策略,确保评估的全面性和多样性。损失函数和网络结构的选择则基于对抗性提示的特性,以提高评估的有效性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,模型在不同语言和提示风格下的安全性表现差异显著,某些类型的有害内容对说服性攻击的脆弱性更高。具体而言,在7200个对抗性提示中,某些风险类别的安全性下降幅度达到30%以上,揭示了当前评估方法的局限性。

🎯 应用场景

该研究的潜在应用领域包括多语言聊天机器人、自动翻译系统和内容生成工具等。通过更准确的安全性评估,能够提升这些系统在多文化环境中的可靠性和安全性,减少潜在的误导性内容生成。未来,IndicSafeEval框架可扩展至其他语言和文化背景,推动全球范围内的安全性研究。

📄 摘要(原文)

Large language models (LLMs) are increasingly used in multilingual settings, yet their safety is still evaluated primarily in English. This limits our understanding of how alignment failures manifest in low-resource and culturally diverse languages. We introduce IndicSafeEval, a persuasion-based jailbreak evaluation framework for Indian languages. Our benchmark combines ten safety critical content categories with six human-like persuasive strategies across four different Indian languages, such as Hindi, Bengali, Marathi and Punjabi, resulting in 7,200 adversarial prompts. We conduct a systematic black-box evaluation of several open-source LLMs to examine how their safety behaviour varies across languages, persuasion strategies, and risk categories. Our analysis shows that the model does not behave equally safely across all languages and prompt styles. Instead, safety performance depends strongly on both the languages used and the way a request is phrased using persuasive cues. We further observe that different risk categories exhibit different levels of vulnerability, with some types of harmful content being significantly more susceptible to persuasion-based jailbreaks than others. These findings reveal important limitations of current safety evaluations, which are largely English-centric, and underscore the need for multilingual and persuasion-aware benchmarking frameworks to more accurately assess real-world LLM safety. Our implementation is available at https://github.com/MonSaikat/IndicSafeEval. Warning: this paper contains example data that may be offensive or harmful.