CC-Mediation: Evaluating Large Language Models for Cross-Cultural Conflict Mediation
作者: Suhyun Lee, Wenxuan Zhang, W. Quin Yow, Yang Deng
分类: cs.CL, cs.AI
发布日期: 2026-09-04
💡 一句话要点
提出CC-Mediation以解决跨文化冲突调解评估问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 跨文化调解 大型语言模型 发展性跨文化敏感性 评估指标 对话数据集 文化冲突 干预策略
📋 核心要点
- 现有方法在跨文化调解中缺乏有效的数据集和评估指标,限制了研究进展。
- 本文提出CC-Mediation基准,包含1661个对话,并引入DMIS基础的评估指标。
- 实验结果表明,当前LLMs在干预时机和调解策略上存在明显不足,需进一步改进。
📝 摘要(中文)
跨文化调解需要大型语言模型(LLMs)在文化背景冲突中决定何时干预及如何回应。现有研究在这方面进展有限,主要由于缺乏可测量的调解数据集和评估跨文化立场变化的原则性指标。为此,本文提出了CC-Mediation,一个基于发展性跨文化敏感性模型(DMIS)的跨文化调解基准,包含1661个十轮对话,涵盖文化冲突、调解干预及干预后的发展轨迹。同时,提出了两个基于DMIS的评估指标:轨迹AUC和有符号Wasserstein-1距离,前者衡量跨文化改善的持久性,后者测量立场变化的幅度和方向。研究发现,当前LLMs在干预时机和调解策略上均存在局限性。
🔬 方法详解
问题定义:本文旨在解决大型语言模型在跨文化冲突调解中的有效性评估问题。现有方法缺乏可测量的调解数据集和评估指标,导致调解效果难以量化。
核心思路:通过构建CC-Mediation基准,提供一个包含文化冲突和调解干预的对话数据集,并引入DMIS基础的评估指标,以量化跨文化立场变化。
技术框架:整体架构包括数据集构建、干预策略设计和评估指标计算三个主要模块。数据集包含十轮对话,干预策略基于DMIS理论,评估指标用于量化干预效果。
关键创新:最重要的创新在于引入了DMIS基础的评估指标,特别是轨迹AUC和有符号Wasserstein-1距离,这些指标能够有效反映跨文化立场的变化及其持久性。
关键设计:在数据集构建中,采用了多样化的文化冲突场景;在评估指标中,轨迹AUC用于衡量改善的持续性,而Wasserstein-1距离则用于分析立场变化的方向和幅度。实验中还考虑了干预时机和策略的设计。
🖼️ 关键图片
📊 实验亮点
实验结果显示,当前LLMs在干预时机和调解策略上均存在显著不足,干预时机的失败主要源于忽视对话内容的先验假设,而调解策略的失败则与模型的后层崩溃有关。通过CC-Mediation基准,研究者能够更清晰地识别这些问题并进行针对性改进。
🎯 应用场景
该研究的潜在应用领域包括国际关系、跨文化沟通和冲突调解等。通过提供有效的调解工具和评估方法,能够帮助不同文化背景的人群更好地理解和解决冲突,促进文化间的和谐共处。未来,该方法有望在实际调解场景中得到广泛应用,提升跨文化交流的效率与效果。
📄 摘要(原文)
Cross-cultural mediation by large language models (LLMs) requires deciding both when to intervene and how to respond in culturally grounded conflicts. Progress on this problem has been limited by the lack of (1) mediation datasets with measurable downstream effects and (2) principled metrics for evaluating intercultural stance change. To address these gaps, we introduce CC-Mediation, a cross-cultural mediation benchmark of $1{,}661$ ten-turn dialogues grounded in the Developmental Model of Intercultural Sensitivity (DMIS), containing culturally grounded conflicts, mediation interventions, and post-intervention trajectories. We further propose two DMIS-based evaluation metrics: Trajectory AUC, which measures the persistence of intercultural improvement over time, and a signed Wasserstein-1 distance, which measures the magnitude and direction of shifts in intercultural stance. Both metrics show strong agreement with human judgment of DMIS-grounded stance shift. Using CC-Mediation, we find that current LLMs have limitations on both axes: intervention timing (when) failure stems from a positional prior that ignores dialogue content, while mediation strategy (how) failure arises from a late-layer elicitation collapse rather than a knowledge deficit.