EviSI: An Evaluation Agent for Simultaneous Interpreting
作者: Ben Yan, Zongyao Li, Daimeng Wei, Weidong Liu, Huan Zhao, Chong Li, Yaode Wang, Yuzhe Shang
分类: cs.CL
发布日期: 2026-09-08
💡 一句话要点
提出EviSI以解决同声传译评估问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 同声传译 语音翻译 评估机制 多维质量指标 语义忠实度 口头表达 机器翻译 自然语言处理
📋 核心要点
- 现有的同声传译评估方法在处理语义忠实度和口头表达时存在不足,难以准确反映翻译质量。
- EviSI通过构建共享源证据,评估语义忠实度和口头表达,采用多维质量指标的原则来改进评估过程。
- 实验结果表明,EviSI在英语到中文的系统排名中与人类评分的平均Kendall一致性达到0.707,表现优于现有基线。
📝 摘要(中文)
同声语音翻译需要在源流持续的情况下进行理解、翻译和口头表达。为了支持及时交付并限制累积延迟,现有系统采用了重构和总结的方法,这可能会在保持意义的同时偏离书面参考。BLEU和COMET可能无法可靠地区分这种变化与语义损失之间的差异。我们提出了EviSI,一个大型语言模型评估代理,适应了多维质量指标(MQM)的错误分析和惩罚原则。EviSI构建共享源证据,评估语义忠实度和口头表达,调和重叠错误并确定性评分。EviSI恢复了英语到中文的整体人类系统排名,英语到中文的平均Kendall一致性达到0.707,中文到英语为0.467,超出了评估的基线。跨五个方向的扩展显示出与COMET的正相关性,而无需人类评分。个别输出与人类的一致性仍然混合。
🔬 方法详解
问题定义:本论文旨在解决同声传译评估中的语义忠实度和口头表达的准确性问题。现有方法如BLEU和COMET在处理重构和总结时,无法有效区分语义损失与变体。
核心思路:EviSI的核心思路是适应多维质量指标(MQM)的错误分析和惩罚原则,通过构建共享源证据来评估翻译的质量。这种设计旨在提高评估的准确性和一致性。
技术框架:EviSI的整体架构包括多个模块:首先是源证据的构建,其次是语义忠实度和口头表达的评估,最后是重叠错误的调和与评分。每个模块都针对特定的评估目标进行优化。
关键创新:EviSI的主要创新在于其采用了多维质量指标的原则,能够更全面地评估翻译质量,尤其是在处理语义变体时,与传统方法相比具有显著优势。
关键设计:在设计上,EviSI使用了特定的损失函数来优化语义忠实度和口头表达的评估,同时在网络结构上进行了调整,以适应多维评估的需求。
🖼️ 关键图片
📊 实验亮点
EviSI在英语到中文的系统排名中与人类评分的平均Kendall一致性达到0.707,中文到英语为0.467,均超出评估的基线。此外,EviSI在五个方向的扩展中显示出与COMET的正相关性,表明其评估能力的有效性。
🎯 应用场景
EviSI的研究成果可广泛应用于同声传译系统的评估与优化,尤其是在多语言翻译场景中。其准确的评估机制将有助于提高翻译质量,进而推动国际交流与合作的发展。未来,EviSI还可能扩展到其他语言对的评估,进一步提升其应用价值。
📄 摘要(原文)
Simultaneous speech-to-speech translation requires understanding, translation and spoken delivery while the source stream continues. To support timely delivery and limit accumulated delay, systems adopt reformulation and summarization, which can preserve meaning while departing from written references. BLEU and COMET may not reliably distinguish such variation from semantic loss. We introduce EviSI, a large language model evaluation agent adapting the error analysis and penalty principles of Multidimensional Quality Metrics (MQM). It constructs shared source evidence, assesses semantic fidelity and oral expression, reconciles overlapping errors and scores deterministically. EviSI recovers the aggregate human system ranking for English to Chinese. Mean Kendall agreement with human system rankings within corpora reaches 0.707 for English to Chinese and 0.467 for Chinese to English, exceeding evaluated baselines. An extension across five directions shows positive concordance with COMET without human ratings. Individual output agreement with humans remains mixed.