The Illusion of Robustness: Aggregate Accuracy Hides Prediction Flips under Task-Irrelevant Context

📄 arXiv: 2607.12963v1 📥 PDF

作者: Yanzhe Zhang, Sanmi Koyejo, Diyi Yang

分类: cs.CL

发布日期: 2026-07-14

备注: Preprint


💡 一句话要点

揭示任务无关上下文对语言模型预测的影响

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 上下文影响 预测不稳定性 逐例评估 自然语言处理 模型可靠性 实验研究

📋 核心要点

  1. 现有大型语言模型在面对任务无关上下文时,整体准确率看似稳定,但实际存在显著的示例级不稳定性。
  2. 论文通过实验揭示了上下文对模型预测的影响,提出了逐例评估语言模型可靠性的必要性。
  3. 研究表明,伪词等无意义上下文能显著影响模型预测,且这种影响在不同模型和数据集上表现出一致性。

📝 摘要(中文)

随着大型语言模型(LLMs)的能力不断增强,它们越来越多地被应用于上下文丰富的环境中,其中任务输入常常伴随着长且部分无关的上下文。在受控环境中,我们发现最先进的模型在整体水平上对任务无关的上下文表现出较强的鲁棒性:将其添加到基准问题上对整体准确率影响不大。然而,这种整体稳定性掩盖了每个示例的不稳定性。即使是通过随机组合字符形成的语义无意义的伪词,也能显著改变模型在少数示例上的预测,导致某些示例性能下降,而另一些则有所提升。这种双向效应在多种模型和数据集上始终存在,但受影响的示例在很大程度上是特定于模型的。我们进一步表明,这种不稳定性受上下文类型、上下文长度、测试时计算能力和模型开发阶段的调节。我们的发现揭示了被整体准确性掩盖的上下文引发的尾部风险,促使对语言模型进行逐例可靠性评估。

🔬 方法详解

问题定义:本文旨在解决大型语言模型在任务无关上下文下的预测不稳定性问题。现有方法未能识别整体准确率掩盖的示例级别不稳定性,导致对模型可靠性的误判。

核心思路:论文的核心思路是通过系统实验揭示上下文对模型预测的影响,强调逐例评估的重要性,以便更好地理解模型在复杂环境中的表现。

技术框架:研究采用受控实验设计,分析不同类型和长度的上下文对模型预测的影响。主要模块包括上下文生成、模型预测和结果分析。

关键创新:最重要的技术创新在于识别并量化了上下文引发的预测波动,尤其是通过伪词等无意义输入对模型的影响,与现有方法的整体准确性评估形成鲜明对比。

关键设计:实验中设置了多种上下文类型和长度,使用了多种主流语言模型进行对比,分析了不同模型在相同上下文下的表现差异。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,添加无意义的伪词上下文能导致模型在某些示例上的预测准确率下降超过20%,而在其他示例上则可能提升。这一发现强调了在评估语言模型时,需关注每个示例的可靠性,而不仅仅是整体准确率。

🎯 应用场景

该研究的潜在应用领域包括自然语言处理、对话系统和智能助手等。通过提高对语言模型在复杂上下文中的可靠性评估,能够增强这些系统在实际应用中的稳定性和用户信任度,推动智能应用的进一步发展。

📄 摘要(原文)

As large language models (LLMs) grow more capable, they are increasingly deployed in context-rich settings where task inputs are often accompanied by long, partially irrelevant context. In a controlled setting, we find that state-of-the-art models often appear robust to task-irrelevant context at the aggregate level: prepending it to benchmark questions causes little change in overall accuracy. This aggregate stability, however, masks significant per-example instability. Even semantically meaningless pseudo-words, formed by randomly combining characters, can markedly shift model predictions on a small fraction of examples, degrading performance on some while improving it on others. This two-sided effect holds consistently across a wide range of models and datasets, yet the affected examples are largely model-specific. We further show that this instability is modulated by context type, context length, test-time compute, and model development stage. Together, our findings reveal context-induced tail risks concealed by aggregate accuracy, motivating per-example reliability evaluation of language models.