GEMBA-MQM: Detecting Translation Quality Error Spans with GPT-4
作者: Tom Kocmi, Christian Federmann
分类: cs.CL
发布日期: 2023-10-21
备注: Accepted to WMT 2023
💡 一句话要点
提出GEMBA-MQM以检测翻译质量错误区间
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 翻译质量评估 GPT-4 机器翻译 语言模型 质量估计 自动评估
📋 核心要点
- 现有的翻译质量评估方法通常依赖于人工参考翻译,限制了其适用性和效率。
- GEMBA-MQM通过使用GPT-4模型和固定的三次提示技术,提供了一种无需人工参考的翻译质量错误检测方法。
- 初步实验结果显示,GEMBA-MQM在系统排名准确性上达到了最先进水平,但需谨慎使用以避免误导性结果。
📝 摘要(中文)
本文介绍了GEMBA-MQM,这是一种基于GPT的评估指标,旨在检测翻译质量错误,特别是在无需人工参考翻译的质量估计场景中。GEMBA-MQM利用大型语言模型(LLM)的能力,采用固定的三次提示技术,查询GPT-4模型以标记错误质量区间。与以往工作相比,我们的方法具有语言无关的提示,从而避免了为新语言手动准备提示的需求。初步结果表明,GEMBA-MQM在系统排名方面达到了最先进的准确性,但我们建议在学术工作中谨慎使用,以展示相对于其他方法的改进,因为它依赖于专有的黑箱GPT模型。
🔬 方法详解
问题定义:本文旨在解决翻译质量评估中对人工参考翻译的依赖问题,现有方法在多语言环境下的适用性较差,且效率低下。
核心思路:GEMBA-MQM利用大型语言模型(GPT-4)进行翻译质量错误检测,通过固定的三次提示技术,避免了为每种新语言手动准备提示的繁琐过程。
技术框架:该方法的整体架构包括数据输入、GPT-4模型查询和错误区间标记三个主要模块。首先,输入翻译文本,然后通过GPT-4进行处理,最后输出标记的错误质量区间。
关键创新:GEMBA-MQM的最大创新在于其语言无关的提示设计,使得该方法可以轻松适用于多种语言,而不需要额外的手动干预。
关键设计:在参数设置上,采用了固定的三次提示形式,以确保模型能够有效理解任务要求。损失函数和网络结构的具体细节未在摘要中详细说明,可能需要进一步的文献查阅。
🖼️ 关键图片
📊 实验亮点
实验结果表明,GEMBA-MQM在系统排名准确性上达到了最先进的水平,具体性能数据未在摘要中提供,但初步结果显示其相较于传统方法有显著提升。由于依赖于GPT模型,建议在学术研究中谨慎使用。
🎯 应用场景
GEMBA-MQM的潜在应用领域包括机器翻译系统的自动评估、翻译质量监控以及翻译服务的质量保证。该方法的实际价值在于提高翻译质量评估的效率和准确性,未来可能推动多语言翻译技术的发展。
📄 摘要(原文)
This paper introduces GEMBA-MQM, a GPT-based evaluation metric designed to detect translation quality errors, specifically for the quality estimation setting without the need for human reference translations. Based on the power of large language models (LLM), GEMBA-MQM employs a fixed three-shot prompting technique, querying the GPT-4 model to mark error quality spans. Compared to previous works, our method has language-agnostic prompts, thus avoiding the need for manual prompt preparation for new languages. While preliminary results indicate that GEMBA-MQM achieves state-of-the-art accuracy for system ranking, we advise caution when using it in academic works to demonstrate improvements over other methods due to its dependence on the proprietary, black-box GPT model.