Lost in Translation, Found in Spans: Identifying Claims in Multilingual Social Media
作者: Shubham Mittal, Megha Sundriyal, Preslav Nakov
分类: cs.CL
发布日期: 2023-10-27
备注: EMNLP 2023 (main)
💡 一句话要点
提出X-CLAIM数据集以解决多语言社交媒体中的声明识别问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 声明识别 多语言处理 社交媒体分析 事实核查 机器学习 数据集构建 跨语言迁移
📋 核心要点
- 现有的声明识别方法主要集中在英语,缺乏对多语言社交媒体内容的研究,导致低资源语言的声明识别问题未得到有效解决。
- 本文提出了X-CLAIM数据集,包含来自五种印度语言和英语的真实声明,旨在通过多语言训练提升声明识别的准确性。
- 实验结果表明,使用多语言训练的编码器模型在低资源语言上表现优于基于翻译数据的迁移学习方法,且GPT系列模型在此任务上的表现不如较小的编码器模型。
📝 摘要(中文)
声明跨度识别(CSI)是事实核查流程中的重要步骤,旨在识别社交媒体帖子中包含值得检查的声明或主张的文本片段。尽管其对记者和人工事实核查者的重要性不言而喻,但这一问题仍然严重缺乏研究,现有研究主要集中在英语上。本文通过创建一个新颖的数据集X-CLAIM,填补了这一空白,该数据集包含来自五种印度语言和英语的7000个真实声明。我们报告了使用最先进的编码器语言模型(如XLM-R)所取得的强基线,并展示了在多语言上训练的优势,相较于零样本迁移或从高资源语言(如英语)翻译数据的替代跨语言迁移方法。我们还评估了GPT系列的生成大型语言模型在X-CLAIM数据集上的表现,发现它们在低资源语言上的表现不如较小的编码器语言模型。
🔬 方法详解
问题定义:本文旨在解决多语言社交媒体中声明识别的不足,现有方法主要集中在英语,导致低资源语言的研究缺乏,影响了事实核查的有效性。
核心思路:通过构建X-CLAIM数据集,包含多种语言的真实声明,利用多语言训练来提升模型在低资源语言上的表现,克服传统方法的局限性。
技术框架:整体架构包括数据集构建、模型选择与训练、以及性能评估三个主要阶段。数据集包含来自社交媒体的真实声明,模型使用最先进的编码器语言模型进行训练与评估。
关键创新:最重要的创新点在于首次针对多种语言构建了大规模的声明识别数据集,并展示了多语言训练的有效性,相较于传统的单语言或翻译方法具有显著优势。
关键设计:在模型训练中,采用了XLM-R等先进的编码器模型,设置了适当的超参数,并设计了针对多语言的损失函数,以优化模型在不同语言上的表现。实验中还对比了不同模型的性能,验证了设计的有效性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,使用X-CLAIM数据集的多语言训练模型在低资源语言上的表现显著优于传统的零样本迁移方法,且在特定任务中,编码器模型的性能超过了GPT系列的生成模型,验证了多语言训练的有效性。
🎯 应用场景
该研究的潜在应用领域包括新闻媒体、社交媒体监控和在线内容审核等。通过提高多语言声明识别的准确性,可以有效支持事实核查工作,提升信息传播的可靠性,具有重要的社会价值和实际意义。
📄 摘要(原文)
Claim span identification (CSI) is an important step in fact-checking pipelines, aiming to identify text segments that contain a checkworthy claim or assertion in a social media post. Despite its importance to journalists and human fact-checkers, it remains a severely understudied problem, and the scarce research on this topic so far has only focused on English. Here we aim to bridge this gap by creating a novel dataset, X-CLAIM, consisting of 7K real-world claims collected from numerous social media platforms in five Indian languages and English. We report strong baselines with state-of-the-art encoder-only language models (e.g., XLM-R) and we demonstrate the benefits of training on multiple languages over alternative cross-lingual transfer methods such as zero-shot transfer, or training on translated data, from a high-resource language such as English. We evaluate generative large language models from the GPT series using prompting methods on the X-CLAIM dataset and we find that they underperform the smaller encoder-only language models for low-resource languages.