鲁棒性的错觉:聚合精度掩盖了任务无关上下文下的预测翻转

arXiv cs.CL 论文

摘要

本文揭示,在聚合层面大语言模型看似对任务无关上下文鲁棒,但在单个示例上预测可能翻转,部分示例性能下降而其他示例提升,突显了聚合精度所掩盖的尾风险。

arXiv:2607.12963v1 公告类型:新 摘要:随着大语言模型能力不断增强,它们越来越多地被部署在上下文丰富的场景中,其中任务输入常伴有冗长且部分无关的上下文。在受控实验中,我们发现最先进的模型在聚合层面往往对任务无关上下文表现出鲁棒性:将其附加在基准问题前对整体准确率影响甚微。然而,这种聚合稳定性掩盖了显著的逐示例不稳定性。即使是随机组合字符形成的语义无意义的伪词,也能在少量示例上显著改变模型预测,导致部分示例性能下降而其他示例提升。这种双向效应在多种模型和数据集上一致成立,但受影响的示例主要因模型而异。我们进一步表明,这种不稳定性受上下文类型、上下文长度、测试时计算量以及模型开发阶段的影响。综合来看,我们的发现揭示了聚合准确率所掩盖的上下文诱导尾风险,从而激发了对语言模型进行逐示例可靠性评估的需求。
查看原文
查看缓存全文

缓存时间: 2026/07/15 04:23

# 鲁棒性的幻象:聚合精度掩盖了无关上下文下的预测翻转
来源:https://arxiv.org/html/2607.12963
Yanzhe Zhang Georgia Tech z\_yanzhe@gatech\.edu &Sanmi Koyejo Stanford University sanmi@stanford\.edu &Diyi Yang Stanford University diyiy@stanford\.edu

###### 摘要

随着大型语言模型(LLMs)能力的不断增强,它们越来越多地被部署在上下文丰富的场景中,任务输入通常伴随着冗长且部分无关的上下文。在受控实验设置下,我们发现在聚合层面,最先进的模型通常对任务无关上下文表现出鲁棒性:将无关上下文附加到基准测试问题前,整体准确率几乎不变。然而,这种聚合稳定性掩盖了显著的逐样例不稳定性。即使是语义上无意义的伪词(通过随机组合字符形成),也可能在少量样例上显著改变模型预测,某些样例性能下降,而另一些则有所提升。这种双向效应在多种模型和数据集上一致存在,但受影响的样例在很大程度上是模型特定的。我们进一步表明,这种不稳定性受到上下文类型、上下文长度、测试时计算量和模型开发阶段的调节。总体而言,我们的发现揭示了聚合准确率所掩盖的上下文引发的尾部风险,这促使需要对语言模型进行逐样例的可靠性评估。111代码和数据可在 https://github.com/SALT-NLP/illusion-of-robustness 获取。

## 1 引言

最先进的大型语言模型(LLMs)越来越多地被部署为在上下文丰富环境中运行的智能体,它们很少能接收到孤立、干净的任务输入。一个编程智能体(Jimenez 等,2024 (https://arxiv.org/html/2607.12963#bib.bib8);Yang 等,2024 (https://arxiv.org/html/2607.12963#bib.bib35))可能需要在执行小幅度代码编辑前检查冗长的源文件、执行日志和中间工具输出。一个深度研究智能体(OpenAI,2025 (https://arxiv.org/html/2607.12963#bib.bib36);Zheng 等,2025 (https://arxiv.org/html/2607.12963#bib.bib40))可能在回答事实性问题前依赖于嘈杂的网络检索结果。一个计算机使用智能体(Xie 等,2024 (https://arxiv.org/html/2607.12963#bib.bib9);Wang 等,2026a (https://arxiv.org/html/2607.12963#bib.bib37))可能在决定下一步行动前处理一长串屏幕截图。在这些场景中,任务相关信号都嵌入在数量大得多的任务无关上下文中。

在这项工作中,我们重新审视了一个常见假设:无关上下文不应显著改变模型的答案。我们使用一个简化设置来隔离任务无关上下文的影响:将其附加到问答基准测试的问题前,并测量性能的变化。

在聚合层面,最先进的模型看似鲁棒:在添加任务无关上下文后,gpt-5.5 和 gpt-5.4 的基准准确率变化分别不超过 ±0.9%\pm 0.9\% 和 ±2.1%\pm 2.1\%。然而,这种表面上的鲁棒性掩盖了显著的逐样例不稳定性,因为潜在现象是双向的:某些问题的性能急剧下降,而另一些则变得“更容易”并出现大幅提升,即使没有提供任何额外的任务相关信息。我们将这种预测翻转称为上下文引发的不稳定性。

这种不稳定性在实际部署中很重要,因为单一步骤的偏移可能触发不可逆的操作或沿着下游决策链传播。为了描述这一现象,我们引入了两个互补的指标。*不稳定性(INS)* 测量所有样例上性能变化的平均绝对值,捕捉模型对无关上下文的敏感程度,无论这种变化是有利还是有害。相反,*最差尾部退化(WTD)* 测量受影响最严重尾部内的平均性能下降,捕捉严重上下文引发故障的风险。

我们在多个数据集(MMLU-Pro (Wang 等, 2024 (https://arxiv.org/html/2607.12963#bib.bib11)), GPQA (Rein 等, 2024 (https://arxiv.org/html/2607.12963#bib.bib41)), Humanity's Last Exam (HLE) (Phan 等, 2025 (https://arxiv.org/html/2607.12963#bib.bib13)), 和 SimpleQA (Wei 等, 2024 (https://arxiv.org/html/2607.12963#bib.bib12)))上的不同模型中都观察到了这一现象,其中 INS 达到 13.6%13.6\% ,WTD 达到 53.2%53.2\% 。尽管现象本身一致,但受影响的特定样例是模型特定的,而不仅仅是数据相关的:跨模型的逐样例性能变化相关性很低(例如,在 MMLU-Pro 上,平均 Pearson rr 为 0.000.00),而且受影响最大的样例重叠度有限(例如,在 MMLU-Pro 上,性能提升最多的 10%10\% 和下降最多的 10%10\% 样例的平均 Jaccard 指数为 0.090.09)。与这种模型特异性一致的是,问题的模糊性与性能变化的相关性也很低。相比之下,模型在每个问题上的不确定性(无上下文)与相应性能变化的幅度有意义地相关,但与方向无关。此外,我们表明上下文引发的不稳定性在多种上下文类型中持续存在,通常随上下文长度增加而增大,可以通过增加测试时计算量部分缓解,并且在模型开发阶段之间变化很大。

总之,这些结果将任务无关上下文确定为上下文丰富的 LLM 部署中隐藏可靠性风险(Rabanser 等,2026 (https://arxiv.org/html/2607.12963#bib.bib57))的一个具体来源。样例级别的预测翻转是双向的,改进和退化在聚合层面大致相互抵消。此外,受影响的样例高度模型特定,使得仅根据数据很难预测哪些样例会失败。因此,我们认为应将上下文鲁棒性评估,包括逐样例不稳定性和最差尾部退化,纳入模型开发中,以支持更可信的下游应用。

参见标题图 1:上下文引发的不稳定性是一种双向效应。我们展示了两个 MMLU-Pro 示例,其中任务无关上下文分别通过影响常识和计算来提升和降低 gpt-5.4 的响应。完整示例见附录 I (https://arxiv.org/html/2607.12963#A9)。

## 2 实验设置

在我们的主要设置中,我们使用伪词来创建任务无关上下文。类似于 (Mohri 等, 2026 (https://arxiv.org/html/2607.12963#bib.bib38)),我们首先生成一个固定的词汇表,由英文字母 (a-z) 组成的随机小写字符串构成,长度在 3 到 8 个字符之间,并过滤掉在英语中出现频率超过阈值的字符串。对于每个上下文,我们从该词汇表中均匀采样伪词,并用空格连接它们。这个过程生成在表面层面上类似于单词样文本的上下文,同时最大限度地减少可识别的词汇或事实内容。注意,伪词上下文并非完全自然。相反,它们提供了隔离效应的最清晰方式。在我们的消融研究(第 3.3 (https://arxiv.org/html/2607.12963#S3.SS3) 节)中测试了更自然的替代方案,如随机采样的 token、网页和问答对。

令 D={d1,...,dN}D=\{d_{1},\ldots,d_{N}\} 为目标评估数据集,其中每个样例 did_{i} 有参考答案 yiy_{i},并令 C={c1,...,cM}C=\{c_{1},\ldots,c_{M}\} 为一组任务无关上下文。对于模型 fLMf_{\mathrm{LM}},我们定义 sij=Pr(Aij=1∣di,cj,fLM)s_{ij}=\Pr(A_{ij}=1\mid d_{i},c_{j},f_{\mathrm{LM}}) 为模型在条件为上下文 cjc_{j} 时,对样例 did_{i} 的潜在正确概率,其中 Aij∈{0,1}A_{ij}\in\{0,1\} 指示模型的响应是否被判断为正确。我们使用 si0s_{i0} 表示相应的无上下文设置。

对于给定的样例 did_{i},平均上下文引发的性能变化为 Δi=1M∑j=1Msij−si0\Delta_{i}=\frac{1}{M}\sum_{j=1}^{M}s_{ij}-s_{i0},位于 [−1,1][-1,1] 区间内。Δi<0\Delta_{i}<0 表示无关上下文损害了样例 did_{i} 的性能,而 Δi>0\Delta_{i}>0 表示无关上下文提升了性能。跨所有样例,平均性能变化为 Δ=1N∑i=1NΔi\Delta=\frac{1}{N}\sum_{i=1}^{N}\Delta_{i}。

从可靠性角度来看,理想的模型在包含无任务相关证据的上下文下应显示出很小的变化。因此,我们定义*不稳定性 (INS)* 为平均绝对变化:

I=1N∑i=1N|Δi|,\mathcal{I}=\frac{1}{N}\sum_{i=1}^{N}|\Delta_{i}|,其中 I∈[0,1]\mathcal{I}\in[0,1]。虽然 INS 捕捉了模型预测的双向敏感性,但更令人担忧的情况是,原本能正确回答的模型在依赖无关上下文后变得不正确。为了隔离有害效应,我们定义*最差尾部退化 (WTD)* 为最差 K%K\% 样例的平均退化。令 m=⌈K100N⌉m=\left\lceil\frac{K}{100}N\right\rceil,并令 Δ(1)≤Δ(2)≤⋯≤Δ(N)\Delta_{(1)}\leq\Delta_{(2)}\leq\cdots\leq\Delta_{(N)} 表示 {Δi}i=1N\{\Delta_{i}\}_{i=1}^{N} 的升序排序值。我们定义:

WK=−1m∑l=1mΔ(l),\mathcal{W}_{K}=-\frac{1}{m}\sum_{\ell=1}^{m}\Delta_{(\ell)},其中 WK∈[−1,1]\mathcal{W}_{K}\in[-1,1],较大的 WK\mathcal{W}_{K} 表示更严重的退化。

分数估计由于 sijs_{ij} 无法直接观察,我们根据模型访问方式和问题格式以不同方式估计它。对于 API 访问模型(我们的主要设置),我们通过对重复采样的响应的二元正确性进行平均来估计 sijs_{ij}。对于具有多项选择题的本地模型(附录 G (https://arxiv.org/html/2607.12963#A7)),一个更简单的估计方法是使用固定答案模板下分配给正确答案选项的概率。在这两种情况下,得到的估计值 s^ij\widehat{s}_{ij} 被视为相同潜在正确概率的测量值。

噪声校正虽然基于 API 访问模型的 s^ij\widehat{s}_{ij} 计算 I^\widehat{\mathcal{I}} 和 W^K\widehat{\mathcal{W}}_{K} 时,有限采样可能会给这两个指标引入正噪声基底,即使无关上下文没有真实效应,因为 INS 使用绝对值而 WTD 选择最差的 K%K\% 尾部。为了估计这种采样引起的噪声,我们使用仅依赖于无上下文样本的 bootstrap 程序。对于每个样例 did_{i},每个 bootstrap 试验构建一个合成零假设实验,其中所有条件都从相同的无上下文分布中采样。具体来说,我们从同一组中独立地重新采样一个伪基线组和 M 个伪上下文组。使用相同的定义,每个 bootstrap 试验给出 I^∗\widehat{\mathcal{I}}^{*} 和 W^K∗\widehat{\mathcal{W}}_{K}^{*}。我们对 bootstrap 试验进行平均,以得到估计的噪声基底 ηI\eta_{\mathcal{I}} 和 ηWK\eta_{\mathcal{W}_{K}},并通过从观察到的指标中减去它们来报告噪声校正指标:Iadj=I^−ηI\mathcal{I}_{\mathrm{adj}}=\widehat{\mathcal{I}}-\eta_{\mathcal{I}} 和 WK,adj=W^K−ηWK\mathcal{W}_{K,\mathrm{adj}}=\widehat{\mathcal{W}}_{K}-\eta_{\mathcal{W}_{K}}。注意,此校正针对的是均值零假设噪声基底。对于不确定性,我们考虑观察到的指标 I^\widehat{\mathcal{I}} 和 W^K\widehat{\mathcal{W}}_{K} 的 bootstrap 方差。我们的调整应被解释为噪声基底校正,而不是上下文效应的无偏估计。在附录 A (https://arxiv.org/html/2607.12963#A1) 中,我们提供了 WTD 的补充拆分样本分析,其中使用不同的样本对样例进行排序并在选定的尾部内估计 Δi\Delta_{i}。

表 1:主要结果 (%)。AVG 指平均基线准确率,Δ\Delta 指添加上下文后的平均性能变化,INS 和 WTD 已进行噪声基底调整。上方模型默认不使用推理,下方模型使用最低推理努力。

参见标题图 2:逐样例性能变化集中于尾部(MMLU-Pro)。对于每个模型,我们按其逐样例变化 Δi\Delta_{i} 从最改进到最退化对样例进行排序,并保留两个 10%10\% 尾部:最改进样例(上方面板)和最退化样例(下方面板)。每个尾部被分为 2%2\% 宽度的百分位区间(x 轴),每个条形报告该区间内一个模型的平均 Δi\Delta_{i}。实心条形显示观察到的变化;覆盖的阴影条形显示相应的估计噪声基底。

表 2:性能变化的定性分析。对于添加任务无关上下文后准确率变化超过 20%20\% 的问题,我们使用每个问题五对比较来注释无上下文和有上下文设置之间的行为差异。该表报告了注释错误类型在配对中的分布 (%)。对于改进的问题,类别表示由添加的上下文纠正的错误;对于退化的问题,类别表示引入的错误。

## 3 实验

实验细节我们使用以下四个数据集:MMLU-Pro (Wang 等, 2024 (https://arxiv.org/html/2607.12963#bib.bib11)), GPQA-Diamond (Rein 等, 2024 (https://arxiv.org/html/2607.12963#bib.bib41)), Humanity's Last Exam (Phan 等, 2025 (https://arxiv.org/html/2607.12963#bib.bib13)), 和 SimpleQA Verified (Wei 等, 2024 (https://arxiv.org/html/2607.12963#bib.bib12); Haas 等, 2026 (https://arxiv.org/html/2607.12963#bib.bib42))。前两个数据集包含多项选择题,后两个包含开放式问题。对于每个数据集,我们随机采样最多 500 500 个问题。我们创建了 M=10 M=10 个伪词上下文,每个

相似文章

谁在翻转?自模型与跨模型反论点揭示LLM答案的不稳定性

Hugging Face Daily Papers

本文引入了一种受控协议,通过用合理的反论点挑战正确答案来评估大型语言模型的答案稳定性,揭示了不同模型之间翻转率的巨大差异,而仅凭准确率指标无法捕捉这些差异。作者发布了该协议、挑战记录以及精心策划的MaxFlip挑战集,以支持稳定性评估。