Choosing the Right Language Mode at Inference Time for Multilingual Reliability
作者: Ekata Mitra, Ameeta Agrawal
分类: cs.CL
发布日期: 2026-09-04
备注: Accepted in Findings of EMNLP 2026
💡 一句话要点
提出RAAI框架以提高多语言模型在低资源语言上的推理可靠性
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多语言模型 推理可靠性 低资源语言 自适应推理 期望校准误差 风险指数 翻译策略
📋 核心要点
- 多语言大型语言模型在低资源语言推理时表现不佳,尤其在理解和准确性方面存在明显不足。
- 提出了可靠性感知自适应推理(RAAI)框架,通过期望校准误差感知的路由和提示融合,优化多语言推理过程。
- 实验结果显示,RAAI在低资源语言上提升了25-37.7%的准确性,并降低了3-6%的校准误差,效果显著。
📝 摘要(中文)
多语言大型语言模型在低至中等资源语言的推理上常常面临挑战。先前的研究表明,翻译可以通过帮助模型访问更强的以英语为中心的表示来改善多语言推理。本文提出了一个核心问题:多语言大型语言模型在推理时需要多少翻译才能可靠地推理,过多的翻译又会导致干扰和过度自信?通过对LLaMA和Qwen模型进行广泛实验,评估了不同文本范围和语言模式(仅目标语言、仅英语、双语)的准确性和可靠性。结果显示,英语上下文通常能改善理解并纠正非英语理解造成的错误,但冗余的双语上下文会加剧干扰。为此,本文提出了可靠性感知自适应推理(RAAI),一个无训练的测试时框架,能够进行期望校准误差(ECE)感知的路由和提示融合,并使用中间层风险指数(RI)来控制顺序推理,仅在有帮助的情况下分配计算资源,抑制有害的双语冗余。RAAI在低资源语言上提高了25-37.7%的准确性,并将校准误差降低了约3-6%,在最低资源语言层级中效果最为显著。
🔬 方法详解
问题定义:本文旨在解决多语言大型语言模型在低资源语言推理中的可靠性问题。现有方法在处理非英语语言时,往往由于缺乏有效的上下文而导致理解错误,且过多的翻译可能引发干扰和过度自信。
核心思路:论文提出的RAAI框架通过动态调整翻译的使用,结合期望校准误差感知的路由和提示融合,旨在优化推理过程,减少冗余信息的干扰。
技术框架:RAAI框架包括两个主要模块:1) ECE感知路由,负责根据输入的上下文动态选择合适的语言模式;2) 中间层风险指数(RI),用于控制推理过程中的计算资源分配,确保在有助于推理时才进行计算。
关键创新:RAAI的核心创新在于其无训练的测试时框架,能够在推理阶段自适应地调整翻译策略,显著提升低资源语言的推理准确性和可靠性。这一方法与传统的静态翻译策略形成鲜明对比。
关键设计:在RAAI中,使用了期望校准误差(ECE)作为路由依据,确保模型在推理时能够选择最优的上下文信息。此外,中间层风险指数(RI)的设计使得模型能够在推理过程中动态评估和调整计算资源的使用,避免冗余的双语信息干扰。
🖼️ 关键图片
📊 实验亮点
实验结果表明,RAAI框架在低资源语言上的准确性提升幅度达到25-37.7%,同时校准误差降低了约3-6%。这些结果在不同模型家族中均表现出一致性,尤其在最低资源语言层级中效果最为显著,展示了该方法的有效性和广泛适用性。
🎯 应用场景
该研究的潜在应用领域包括多语言翻译、跨语言信息检索和低资源语言的自然语言处理。通过提高多语言模型在低资源语言上的推理可靠性,RAAI框架能够为多语言应用提供更准确的支持,推动相关技术的发展和普及。未来,该方法可能在教育、文化交流和全球化商业等领域产生深远影响。
📄 摘要(原文)
Multilingual large language models often struggle to reason in low- to mid-resource languages. Prior work has shown that translation can improve multilingual reasoning by helping models access stronger English-centric representations. This raises a central question: How much translation is needed for multilingual large language models to reason reliably, and when does more translation instead trigger interference and overconfidence? Using LLaMA and Qwen models, we run extensive experiments varying text scope and language mode (target-only, English-only, bilingual) to evaluate both accuracy and reliability. Our results reveal a clear trade-off: English context often improve understanding and recover errors caused by non-English comprehension, yet adding redundant bilingual context intensifies interference. We address this trade-off with Reliability-Aware Adaptive Inference (RAAI), a training-free test-time framework that (i) performs Expected Calibration Error (ECE)-aware routing and prompt fusion, and (ii) uses a mid-layer Risk Index (RI) to gate sequential reasoning, allocating compute only when it is likely to help and suppressing harmful bilingual redundancy. Across two model families, RAAI enhances accuracy by 25-37.7% on low-resource languages and lowers calibration error by approximately 3-6%, with the most pronounced benefits in the lowest-resource language tiers.