长上下文LLM中的位置失败:推理基准测试的盲点
摘要
本论文识别出长上下文LLM推理基准测试中的一个盲点:它们未能控制任务在上下文中的位置,导致位置失败未被检测到。作者提出上下文旋转评估(CRE)来系统地改变任务位置、填充内容和上下文长度,揭示出当推理任务放置在长上下文中时,某些模型的准确率会严重下降。
arXiv:2605.23170v1 Announce Type: new
摘要:位置控制评估对于检索任务(如Needle-in-a-Haystack和RULER)是标准做法,但主流的推理基准测试并未控制长上下文中目标任务的位置。我们审查了11个长上下文基准测试,发现没有一个同时控制任务位置、填充内容和上下文长度以进行推理。对四个旗舰长上下文版本的审查发现,在主要结果表格中没有任何NIAH、RULER或LongBench系列基准测试的条目,而智能体和编码基准测试则出现在所有四个版本的主要结果表格中。我们提出上下文旋转评估(CRE),这是一个控制所有三个因素的框架,并在两轮(初始五模型集和四个较新的供应商发布)中对GSM8K和ARC-Challenge上的九个LLM进行了评估。当目标任务从末尾移到中间时,模型可能会急剧下降,并且对于易受影响的模型,下降会随着上下文长度的增加而恶化。MiMo-v2-Flash在64K下使用with_solutions填充时下降了88个百分点(中间准确率8%)。较新的版本下降较小:在64K下,四个中有三个保持在末端位置准确率±6个百分点以内;MiMo-V2.5-Pro将MiMo-v2-Flash的88个百分点下降缩小到32个百分点。在questions_only_v2填充下,所有四个模型的中间位置下降仍然存在(在8K、32K、64K下范围从-16到-56个百分点)。在8K下,一个诊断探针在末尾添加目标任务副本,使所有九个模型中间准确率与末端基线相差±4个百分点以内,这与位置解释一致。在初始五模型集中,76%的中间位置错误与周围填充文本匹配,而末端位置为22%,这与填充答案干扰作为主要错误模式一致。这些结果暴露了当前推理基准设计及供应商评估实践中的结构性评估缺口:当任务位置未受控制时,随上下文长度增长的位置脆弱性无法被测量。
查看缓存全文
缓存时间: 2026/05/25 09:00
# 推理基准中的盲区 来源:https://arxiv.org/html/2605.23170 ## 长上下文大语言模型中的位置性失败:推理基准中的盲区 张楚逸 北京交通大学 24222058@bjtu\.edu\.cn&崔鸿宇 中南林业科技大学 zoean@csuft\.edu\.cn黄晓雯 北京交通大学 xwhuang@bjtu\.edu\.cn&桑基韬 北京交通大学 jtsang@bjtu\.edu\.cn ###### 摘要 位置可控评估在检索任务(如 Needle-in-a-Haystack 和 RULER)中被广泛采用。相比之下,主流推理基准未能控制目标任务在长上下文中的位置布局。我们审计了 11 个流行的长上下文基准,发现没有一个能同时控制推理任务的位置、填充内容和上下文长度。对近期四个旗舰长上下文模型发布的审计显示,在 NIAH、RULER 或 LongBench 系列基准上,没有任何主要结果表格条目,而 agent 和编码基准在所有四个发布的表格中都出现。因此,这些被审计的厂商结果表格几乎无法直接反映位置可控的推理行为。针对这些基准设计和厂商评估实践中的空白,我们提出 Context Rot Evaluation (CRE),这是一个系统性地变化所有三个因素的受控框架。我们在 GSM8K 和 ARC-Challenge 上评估了九个模型,分为两轮:一个初始的五模型集合和四个更新的厂商发布。当目标任务从上下文末端移至中间时,模型性能可能急剧下降,且对于易受影响的模型,下降程度随上下文长度增加而恶化。例如,MiMo-v2-Flash 在 64K 长度下使用 with_solutions 填充时下降了 88 个百分点,中间位置准确率降至 8%。更新的模型在相同填充下表现出较小的中间位置下降。在 64K 长度下,四个模型中有三个的中间位置准确率与末端位置相差在±6个百分点以内。MiMo-V2.5-Pro 将 MiMo-v2-Flash 的 88 个百分点下降缩小至 32 个百分点。在使用 questions_only_v2 填充时,所有四个模型在中间位置仍存在下降(在 8K、32K 和 64K 范围内下降 16 至 56 个百分点)。在 8K 长度下,一项诊断性探测(在末端添加目标任务副本)使所有九个模型的中间位置准确率与末端位置基线相差在±4个百分点以内。这一模式与位置性解释一致。在初始五模型集合中,76% 的中间位置错误与周围填充文本匹配,而末端位置仅为 22%,这与填充-答案干扰作为主要错误模式一致。这些结果暴露了当前推理基准设计和厂商评估实践中的结构性评估空白:当任务位置不受控制时,随上下文长度增长的位置性漏洞无法作为独立效应被测量。 长上下文大语言模型中的位置性失败:推理基准中的盲区 张楚逸 北京交通大学 24222058@bjtu\.edu\.cn 崔鸿宇 中南林业科技大学 zoean@csuft\.edu\.cn 黄晓雯††感谢:通讯作者。 北京交通大学 xwhuang@bjtu\.edu\.cn 桑基韬 北京交通大学 jtsang@bjtu\.edu\.cn ## 1 引言 现代长上下文 LLMs 声称拥有 128K 标记或更多的有效上下文窗口。这些声称是否成立取决于我们如何评估它们。对于检索任务,位置控制已是标准做法:Needle-in-a-Haystack (Kamradt, 2023 (https://arxiv.org/html/2605.23170#bib.bib8)) 在上下文深度上扫描答案位置,RULER (Hsieh et al., 2024 (https://arxiv.org/html/2605.23170#bib.bib7)) 增加了可配置的任务复杂度。相比之下,主流长上下文推理基准遵循不同的实践:任务位置很少被控制或明确报告。代表性套件包括 SCROLLS (Shaham et al., 2022 (https://arxiv.org/html/2605.23170#bib.bib17))、LongBench (Bai et al., 2024 (https://arxiv.org/html/2605.23170#bib.bib2))、L-Eval (An et al., 2023 (https://arxiv.org/html/2605.23170#bib.bib1)) 和 LooGLE (Li et al., 2023 (https://arxiv.org/html/2605.23170#bib.bib10)),它们在自然文档上评估模型,其中任务相关信息的位置继承自源文档而非经过实验选择。 检索与推理基准之间的这种不对称引入了一个评估空白。自然文档推理基准只能报告模型在长上下文任务上的聚合性能,但无法区分成功或失败与任务位置的关系。如果模型在某些位置失败而在其他位置不失败,当基准不控制任务位置时,这些失败将无法被表征。在所调查的基准中,没有一个能同时控制推理任务的位置、填充内容和上下文长度。这一空白是否在经验上重要仍是一个开放问题。 然后我们审计了近期四个旗舰发布(DeepSeek-V4-Pro、MiMo-V2.5-Pro、Kimi-K2.6 和 GLM-5.1)如何报告其自身的评估结果,相同的空白也出现在厂商自己的表格中。在这四个发布中,本审计追踪的七个长上下文基准家族(NIAH、RULER、LongBench、HELMET、∞Bench、BABILong、LOFT)在所有二十八个主要结果表格审计单元中均未出现。相比之下,每个厂商的头条比较都包含了 SWE-Bench 和浏览器或终端导向的 agent/编码基准,例如 BrowseComp、Terminal-Bench、ClawEval 或 GDPVal。例如,DeepSeek-V4-Pro 在其主要 Instruct 表格中报告了 SWE-Bench Verified 80.6、BrowseComp 83.4 和 Terminal-Bench 67.9。NIAH 和 RULER 缺失,LongBench-V2(51.5 EM)仅出现在 Base 评估表格中。GLM-5.1 在稀疏注意力的 9B 代理架构消融中报告了 NIAH 和 RULER,而非作为已部署产品的主要位置保真度声明。完整的厂商披露矩阵见附录 G (https://arxiv.org/html/2605.23170#A7)。 这四家厂商在其主要结果表格中优先展示 agent 和编码任务分数,而非位置推理分数。agent 和编码基准上的高分本身并不能表征位置可控的推理行为。位置可控基准隔离了这些厂商表格中未表征的变量:推理性能如何随任务位置变化。这一测量空白促使了 CRE 的提出。 我们的工作弥合了这些空白。我们首先审计了 11 个长上下文基准(第 2 节 (https://arxiv.org/html/2605.23170#S2)),并记录了一个结构性不对称:位置可控评估在检索领域已被良好建立,但在主流推理基准设计中基本缺失。基于这一审计,我们提出了 Context Rot Evaluation (CRE),一个受控框架,系统性地变化三个因素——任务位置、填充内容和上下文长度——用于推理任务。CRE 在两轮中评估了九个 LLMs:一个初始集合(Qwen 2.5-7B-Instruct、MiMo-v2-Flash、GLM-4.7-FlashX、DeepSeek-V3.2 推理模式、Kimi k2.5)加上四个更新的厂商发布(DeepSeek-V4-Pro、MiMo-V2.5-Pro、Kimi-K2.6、GLM-5.1),在三个上下文层级(8K、32K、64K)和三种填充类型(已解答案例、未回答问题、中性维基百科/新闻散文)上进行测试。推理任务为 GSM8K (Cobbe et al., 2021 (https://arxiv.org/html/2605.23170#bib.bib5))(数学应用题)和 ARC-Challenge (Clark et al., 2018 (https://arxiv.org/html/2605.23170#bib.bib4))(科学多选题)。通过此设置,我们描述了一个模型依赖的漏洞谱,并分析了不同填充类型和上下文长度下的诊断探测行为。 在结构化填充条件下,端到中间下降在 GSM8K 上达到 94 个百分点;76% 的中间位置错误与填充内容匹配,而末端为 22%,这与填充-答案干扰作为主要错误模式一致。 我们的贡献是: - • 对 11 个长上下文基准的系统性位置审计:位置感知评估在检索方面相对成熟,但在主流推理方面基本未被审计;像 BABILong 和 LongReason 这样的合成例外并未弥补这一空白(第 2 节 (https://arxiv.org/html/2605.23170#S2) 和附录 F (https://arxiv.org/html/2605.23170#A6))。 - • 证据表明任务位置、填充内容和上下文长度共同塑造推理失败。在 GSM8K 上端到中间下降达到 94 个百分点,在 ARC-Challenge 上有跨领域方向性支持(下降 6 至 40 个百分点);不控制任务位置的基准会遗漏这些效应(第 4 节 (https://arxiv.org/html/2605.23170#S4))。 - • 一个模型依赖的漏洞谱:某些模型在中间位置急剧下降,其他模型几乎完全免疫。诊断探测行为与这些失败的位置性解释一致(第 4.2 节 (https://arxiv.org/html/2605.23170#S4.SS2))。 ## 2 相关工作 长上下文 LLMs 中的位置效应自 Liu et al. (2023 (https://arxiv.org/html/2605.23170#bib.bib12)) 以来已被记录。他们表明多文档 QA 模型对上下文中间信息的关注度低于开头或结尾的信息。这一结果引发了一系列直接操控位置的合成检索式基准。 Needle-in-a-Haystack (Kamradt, 2023 (https://arxiv.org/html/2605.23170#bib.bib8)) 确立了在上下文深度上扫描答案位置的基本协议。RULER (Hsieh et al., 2024 (https://arxiv.org/html/2605.23170#bib.bib7)) 将此想法扩展为一个可配置的合成套件,涵盖检索、变量追踪和聚合任务。后来的基准如 LongPiBench (Tian et al., 2025 (https://arxiv.org/html/2605.23170#bib.bib19))、NoLiMa (Modarressi et al., 2025 (https://arxiv.org/html/2605.23170#bib.bib14)) 和 Counting-Stars (Song et al., 2025 (https://arxiv.org/html/2605.23170#bib.bib18)) 进一步扩展了位置感知评估,包括多证据设置、均匀位置网格和深度对齐分析。Counting-Stars 包含一个带推理标签的子任务,但它仍然是一个刻意简化的合成基准,以多证据收集为中心。作者本人指出该任务不需要求和。总体而言,这些研究表明,当位置被视为一个首要变量时,位置效应是可测量的。但它们仍然主要是针对检索式或代理任务的受控合成基准,而非对主流长上下文推理评估的审计。 相比之下,主导长上下文推理和 NLU 评估的基准通常不控制或报告目标信息的位置。SCROLLS (Shaham et al., 2022 (https://arxiv.org/html/2605.23170#bib.bib17))、ZeroSCROLLS (Shaham et al., 2023 (https://arxiv.org/html/2605.23170#bib.bib16))、L-Eval (An et al., 2023 (https://arxiv.org/html/2605.23170#bib.bib1))、LongBench (Bai et al., 2024 (https://arxiv.org/html/2605.23170#bib.bib2))、LooGLE (Li et al., 2023 (https://arxiv.org/html/2605.23170#bib.bib10)) 和 100-LongBench (Yang et al., 2025 (https://arxiv.org/html/2605.23170#bib.bib21)) 在现实长文档任务上评估模型。任务相关证据的位置来自自然文档而非实验控制,因此这些基准无法孤立成功或失败是否取决于任务出现的位置。InfiniteBench (Zhang et al., 2024 (https://arxiv.org/html/2605.23170#bib.bib22)) 在一个基准内展示了这种分割:它结合了位置可控的检索子任务(PassKey 变体)和位置不受控制的自然文档推理子任务。 与我们审计最接近的先例是 Buchmann et al. (2024 (https://arxiv.org/html/2605.23170#bib.bib3))。他们研究了六个长文档归因数据集,并报告当证据出现在文档较后位置时,回答质量倾向于下降。其范围比我们窄:它专注于归因基准,未检查主流推理基准构建是否系统性遗漏了位置漏洞的测量。 Pos2Distill (Wang et al., 2025 (https://arxiv.org/html/2605.23170#bib.bib20)) 也密切相关。它明确区分了位置偏差的检索和推理表现,但这是为了缓解而非基准审计。LongReason (Ling et al., 2025 (https://arxiv.org/html/2605.23170#bib.bib11)) 通过关于最终查询放置的二元消融,为位置感知评估提供了一个合成推理方面的先例。它表明推理性能可能取决于最终查询出现在背景上下文之前还是之后。然而,其位置控制仍然粗粒度,并未构成跨基准审计或联合位置-内容-长度评估。这些工作共同加强了位置效应对推理重要的论点,但它们并未消除 CRE 所针对的基准设计空白。 BABILong (Kuratov et al., 2024 (https://arxiv.org/html/2605.23170#bib.bib9)) 是最接近的早期合成推理先例:它在较长干扰文本中评估基于支持事实的推理,但将位置视为辅助而非主要评估轴。RULER 的变量追踪任务接近共指式推理,但评估的是信息定位而非 SCROLLS 或 LongBench 所针对的多步自然语言推理。 在此背景下,CRE 贡献了一个缺失的评估层。我们并非引入另一个位置感知的合成任务,而是将跨基准位置审计(附录 F (https://arxiv.org/html/2605.23170#A6))与一个针对推理任务的受控评估框架相结合。通过在九个模型上联合操控 GSM8K 和 ARC-Challenge 的任务位置、填充内容和上下文长度,CRE 揭示了一个被以检索为中心的位置基准和自然文档推理基准共同忽视的评估空白。“上下文腐蚀”(context rot) 一词也出现在业界文章(例如 Chroma Research)中,用于描述检索端上下文退化;CRE 则针对一个不同的、推理端的问题。 ## 3 方法 ### 3.1 CRE 框架 参见标题 图 1:CRE 评估框架。(A) 主实验设计:填充类型(with_solutions、questions_only_v2、neutral_text)和上下文长度(8K、32K、64K)的 3×3 全因子设计;每个单元比较末端与中间位置,每个条件 N=50,种子 seed=42。(B) 位置布局:end 和 middle 是主要比较;middle_twice 和 middle_dup 作为诊断探测,仅在 8K 长度下评估。 CRE (Context Rot Evaluation) 是一个受控评估框架,将任务位置、填充内容和上下文长度视为三个独立变量(图 1 (https://arxiv.org/html/2605.23170#S3.F1))。对于每个推理任务实例,我们通过将目标问题嵌入到指定位置的填充内容中,并在指定的标记预算内构建一个提示。一个全因子设计在每个轴向上独立变化,同时固定其他两个轴,因此可以在保持其他轴固定的情况下比较准确率差异。 我们评估四个位置变体:end(目标任务在上下文末尾,紧接模型响应之前)、middle(目标任务在上下文中间,两侧有填充)、middle_twice(目标任务在中间重复两次,末尾无副本)、middle_dup(目标任务在中间出现一次并在末尾重复一次)。end 和 middle 条件隔离主要位置效应;middle_twice 和 middle_dup 是第 4.2 节 (https://arxiv.org/html/2605.23170#S4.SS2) 中使用的诊断探测。
相似文章
真实场景下的对比归因:针对现实基准中大模型失效的可解释性分析
研究者采用基于LRP的对比归因方法,分析大模型在现实基准中失败的原因,发现该方法在某些场景下能提供有用信号,但并非始终可靠。
通过PredicateLongBench理解长上下文任务的难度轴
本文介绍了PredicateLongBench,这是一个通过测试模型识别满足谓词的连续子序列的任务来系统性地探测长上下文推理的基准,揭示了前沿模型在多个难度轴向上扩展时表现困难。
Context Is Not Control:面向LLM的源边界评估
一篇介绍《Context Is Not Control》的论文,该基准评估LLM在处理受控文本中介证据时的源边界失效问题。附带开放权重模型和前沿API模型的复现包。
LinAlg-Bench:揭示大语言模型数学推理中结构性失败模式的诊断性基准
介绍了LinAlg-Bench,这是一个诊断性基准,用于评估10个前沿大语言模型在矩阵维度上的结构化线性代数计算,揭示了大语言模型的数学失败在结构上受到约束,并在4x4规模下从执行错误过渡到计算放弃。
量化LLM推理中的无声失败:基于分类法的空洞收敛与失败模式转变分析
本文通过一个基于分类法的分析,对多个模型和基准测试中的30,000个思维链输出进行研究,证明了训练后量化可以无声地改变大语言模型的推理方式,即使任务准确性保持不变。