通过PredicateLongBench理解长上下文任务的难度轴
摘要
本文介绍了PredicateLongBench,这是一个通过测试模型识别满足谓词的连续子序列的任务来系统性地探测长上下文推理的基准,揭示了前沿模型在多个难度轴向上扩展时表现困难。
arXiv:2607.08284v1 公告类型:新发布
摘要:大型语言模型(LLMs)在长上下文能力上展现出快速提升,催生了一波用于评估它们的基准。然而,现有的长上下文评估——从“大海捞针”(NIAH)测试到最近的多跳推理和摘要任务——主要衡量平均性能,且许多要么已饱和,要么缺乏鲁棒性。尤为缺失的是,一种系统性的方法来探究模型在不同难度轴向的任务规模扩展时的表现。我们通过提出PredicateLongBench填补了这一空白,该基准通过要求模型在长输入中识别满足给定谓词/约束(例如字典序)的最长连续单词子序列来对长上下文推理进行压力测试,这些谓词来自更广泛的谓词类别。我们基准的核心创新在于识别并系统探索多个不同难度轴,这些轴测试长上下文理解的多个方面。我们提供了两个互补的生成流程——一个完全合成的设置,使用随机类单词字符串;另一个是真实世界的设置,从自然文档中采样单词同时保留其分布特性。我们发现,随着任务沿我们的难度轴扩展,前沿模型难以表现良好,这展示了我们基准在理解当前长上下文能力局限性方面的实用性。此外,PredicateLongBench中的任务虽具挑战性,但概念上简单,且不依赖于基于LLM的生成或评判。
查看缓存全文
缓存时间: 2026/07/10 06:08
# 理解长上下文任务中的难度轴:基于 PredicateLongBench 来源:https://arxiv.org/html/2607.08284 ###### 摘要 大型语言模型(LLMs)在长上下文能力上展现出快速进步,这催生了一波用于评估它们的新基准。然而,现有的长上下文评估——从“大海捞针”(NIAH)测试到更近期的多跳推理和摘要任务——主要衡量平均性能,且许多要么已经饱和,要么缺乏鲁棒性。尤其缺失的是一种系统性的方式,来探究模型在面对任务难度沿不同轴提升时的表现。为解决这一空白,我们提出了 **PredicateLongBench**,这是一个通过要求模型识别长输入中满足给定谓词/约束(例如字典序)的最长连续单词子序列(选自更广泛的谓词类)来对长上下文推理进行压力测试的基准。我们的基准的核心创新在于识别并系统探索了多个不同的难度轴,这些轴测试了长上下文理解的多个方面。我们提供了两条互补的生成流水线——一条是完全合成的随机类词字符串设置,另一条是从自然文档中采样单词并保留其分布特性的真实世界设置。我们发现,前沿模型在沿这些轴扩展任务难度时表现挣扎,这证明了我们的基准在理解当前长上下文能力局限性方面的实用性。此外,PredicateLongBench 中的任务虽然具有挑战性,但在概念上简单,且不需要基于 LLM 的生成或评判。 ## 1 引言 大型语言模型(LLMs)近年来在长上下文性能上有所提升。随着越来越多能够处理更长上下文的强大模型涌现,对用于评估模型长上下文能力的鲁棒基准的需求也日益增长。长上下文性能最早的一个标志是流行的“大海捞针”(NIAH)测试,它评估模型在“干草堆”(一个大的上下文窗口)中隐藏的“针”(微小的局部化信息片段)的能力(Kamradt, 2023(https://arxiv.org/html/2607.08284#bib.bib16);Mohtashami 和 Jaggi, 2023(https://arxiv.org/html/2607.08284#bib.bib17))。人们设计了多种 NIAH 变体来增加任务难度,例如嵌入多根针、在上下文中添加干扰项等。然而,NIAH 任务仍有局限性,通常仅限于定位高度局部化的微小信息片段。为了衡量更广泛的长上下文能力,人们开发了其他长上下文评估,这些评估以问答(QA)、多跳推理、摘要等形式引入了更多的任务多样性。 研究人员试图沿着多个轴增加长上下文评估的难度。最自然的一个轴是**上下文长度**,因为增加任务的基础上下文长度要求模型在更大的文本海洋中查找或推理信息。为此,许多流行的长上下文基准(例如 RULER(Hsieh 等人,2024(https://arxiv.org/html/2607.08284#bib.bib2))、HELMET(Yen 等人,2025(https://arxiv.org/html/2607.08284#bib.bib3)))都是可配置的,并能适应任何期望的上下文长度,从而可以测试性能在递增的上下文长度列表上的退化情况。另一个轴是使用**干扰项**,这些是周围的文本块,旨在隐藏上下文窗口中的关键信息。例如,早期的 NIAH 测试(如 RULER 中的测试)使用了不相关的内容块(例如像“草是绿的”这样的填充短语、来自文档或论文的句子等)来混淆针(键值对)。较新的 NIAH 任务(如 NoLiMa 中的任务(Modarressi 等人,2025(https://arxiv.org/html/2607.08284#bib.bib4)))使用了更复杂的干扰项,这些干扰项被设计成与相关文本语义相似。干扰项也出现在其他类型的任务中,例如 QA 中,主题相似的段落可能分散在上下文中。 **计算**是另一个可以沿着其扩展难度的轴。一个长上下文任务可以通过引入额外的计算步骤来变得更具挑战性。例如,许多 QA 任务被明确设计为多跳任务,因此要求模型从上下文的不同部分获取连续的信息片段,每个后续查询都由前一次检索的结果引导。其他包含计算的长上下文任务包括跨文档 QA、文档摘要和长代码库理解。 与计算相关的一个轴是**非局部性**,指的是给定任务要求模型检查整个上下文窗口才能得出正确答案的概念。NIAH 任务以局部性著称,即键值对包含在上下文的一个小局部窗口内,一旦找到所需的键,模型就无需查看上下文的其余部分。另一方面,有些任务高度非局部,例如摘要或频率计数任务(如 RULER 中的 CWE/FWE)。我们在本文后面以**量词复杂度**的形式细化了这一概念。 许多长上下文评估基准只沿某些轴(而非其他轴)扩展难度。此外,扩展难度往往伴随着任务复杂度的显著增加,例如要求使用 LLM 来生成上下文/任务或评判响应。受此现状驱动,我们提出了 **PredicateLongBench**,这是一个新的任务家族,它在保持简洁性的同时,结合了多种方法以跨多个轴扩展难度。我们的主要贡献如下:(1)我们提出了 PredicateLongBench,一个任务家族,这些任务在算法上简单,但对前沿 LLM 构成挑战;(2)我们系统地定义并探索了多个用于增加任务难度的轴,并提出了沿这些轴扩展难度的简单检索任务的变体;(3)我们设计了用于约束满足的谓词,使我们能够沿这些轴扩展简单检索任务的难度;(4)我们针对上下文结构(特别是干扰项)进行了实验,表明该结构对前沿模型在这些任务上的性能有重大影响;(5)我们探索了沿一个新轴(即搜索空间)增加难度,这个轴即使在保持上下文 token 预算固定的情况下也可以扩展。 ## 2 相关工作 已有多个包含多样任务套件的长上下文基准被提出。我们在此重点介绍这些工作。 ##### 高级 NIAH 任务。 多个基准在标准 NIAH 范式上进行了构建,增加了额外复杂性以使任务更具挑战性。例如,NoLiMa(Modarressi 等人,2025(https://arxiv.org/html/2607.08284#bib.bib4))构建了带有精心设计的针集的 NIAH 任务,这些针集旨在最小化与干草堆的词汇重叠。其他近期 NIAH 基准探索了关于并行性(NeedleThreading,(Roberts 等人,2024(https://arxiv.org/html/2607.08284#bib.bib7)))、多语言检索(MLNeedle,(Hengle 等人,2025(https://arxiv.org/html/2607.08284#bib.bib8)))、上下文内特征(DENIAHL,(Dai 等人,2024(https://arxiv.org/html/2607.08284#bib.bib9)))、代码仓库(RepoQA,(Liu 等人,2024(https://arxiv.org/html/2607.08284#bib.bib10)))等的想法。 ##### 多轮共指消解(MRCR)。 Reid 等人(2024(https://arxiv.org/html/2607.08284#bib.bib12))引入的**多轮共指消解(MRCR)** 任务以用户与模型之间的对话(用户要求模型就不同主题写文章、诗歌等)作为上下文,然后要求模型根据给定的请求重现来自对话的输出。这可以被视为一种高级 NIAH 任务,其中相关对话是“针”,由键(请求)触发。MRCR 构成了流行基准的基础,例如 Michelangelo(Vodrahalli 等人,2024(https://arxiv.org/html/2607.08284#bib.bib1))、OpenAI-MRCR(OpenAI, 2025b(https://arxiv.org/html/2607.08284#bib.bib14))等。 ##### 基于图的基准。 长上下文评估中一个较新的方向是探索图上的任务。图为构建多跳任务提供了自然途径。例如,在 OpenAI-Graphwalks(OpenAI, 2025a(https://arxiv.org/html/2607.08284#bib.bib13))基准中,模型被提供了一个大图的边列表,任务涉及图遍历(例如广度优先搜索)。该基准增加了超出标准多跳任务的复杂性,因为单次顺序图遍历不足以解决这些任务。 ##### 现实世界基准。 虽然上述许多基准涉及**合成**任务,但最近人们对于设计**现实世界**任务产生了兴趣。这类任务通常分为几类,例如问答(QA)、摘要、上下文内学习、文档检索与重排序、检索增强生成(RAG)、代码任务等。专注于现实世界长上下文任务的基准包括 HELMET(Yen 等人,2025(https://arxiv.org/html/2607.08284#bib.bib3))、LongBench(Bai 等人,2024(https://arxiv.org/html/2607.08284#bib.bib5))、LongBench v2(Bai 等人,2025(https://arxiv.org/html/2607.08284#bib.bib6))、InfinityBench(Zhang 等人,2024(https://arxiv.org/html/2607.08284#bib.bib15))、Long Code Arena(Bogomolov 等人,2024(https://arxiv.org/html/2607.08284#bib.bib20))、NoCha(Karpinska 等人,2024(https://arxiv.org/html/2607.08284#bib.bib11))等。 ##### 其他指标。 除了长上下文基准,许多人还研究了诸如困惑度等标准指标作为长上下文性能的代理。虽然一些人将低困惑度分数视为模型成功扩展上下文窗口的迹象,但一些研究指出困惑度与实际长上下文任务性能之间存在巨大差距(Hu 等人,2024(https://arxiv.org/html/2607.08284#bib.bib18);Hsieh 等人,2024(https://arxiv.org/html/2607.08284#bib.bib2))。一些工作试图通过对困惑度进行适当修改来弥补这一差距。例如,Fang 等人(2025(https://arxiv.org/html/2607.08284#bib.bib19))引入了 LongPPL,一种对 token 困惑度的加权平均,为选定的关键 token(依赖于更长上下文的 token)赋予更高权重;以及 LongCE 损失,一种用于微调的重加权策略。 ## 3 PredicateLongBench 基准 ### 3.1 任务设置 总体设置是提供一个长上下文窗口,其中包含一个由空格分隔的单词列表。我们基准中的一个典型任务要求模型识别满足约束(选自某个谓词类)的最长连续单词子序列。更精确地说,假设我们有一个谓词类 H⊆{(an)↦{0,1}}。一个任务由谓词列表 f1,f2,...,fj∈H 定义,任务是找到最大的 k,使得存在一个连续的单词子序列 w=(w1,w2,...,wk) 满足对于 i=1,2,...,j,fi(w)=1。 ### 3.2 谓词 前面描述的任务非常通用。具体任务由谓词的选择定义。我们在此讨论具体的谓词。 #### 3.2.1 一元谓词 这些谓词仅依赖于单个单词,即对于单个 i,f(w1,w2,...,wk):=f(wi)。仅有单谓词的任务是最简单的任务类型,因为谓词独立地作用于序列中的各个单词。 ##### 前缀/后缀/字符串匹配一元谓词任务。 在这项工作中,我们考虑与字符串包含相关的一元谓词。具体来说,我们考虑函数 pres,i, suffs,i, conts,i: - • pres,i(w)=1 当且仅当字符串 s 是 wi 的前缀。 - • suffs,i(w)=1 当且仅当字符串 s 是 wi 的后缀。 - • conts,i(w)=1 当且仅当字符串 s 包含在 wi 中。 #### 3.2.2 二元谓词 在这种情况下,每个谓词依赖于序列中的至多两个单词,即对于两个索引 i1,i2,f(w):=f(wi1,wi2)。这样的谓词允许更具挑战性的任务,因为它们模拟了序列中两个不同单词之间的交互。 ##### 字典序谓词。 在这项工作中,我们考虑涉及输出按字典序排列的单词序列的任务。**字典序谓词** f 满足:f(w1,w2,...,wk)=1 当且仅当 w1≼w2≼⋯≼wk,其中 x≼y 表示 y 在标准字典序中不早于 x。f 可以分解为二元谓词,如下所示:f(w1,w2,...,wk)=1 当且仅当对于所有 i=1,2,...,k−1,lexi(w)=1,其中 lexi(w) 为 1 当且仅当 wi≼wi+1。直观上,一个序列按字典序排列当且仅当相邻单词对是按顺序的。 ### 3.3 难度轴 如引言中所述,我们工作的一个主要贡献是定义并系统探索任务的各种难度轴。我们在此将这些轴放在我们的任务设置背景下进行概述。 #### 3.3.1 计算 我们任务的一个关键方面是检索需要一定程度的计算,因为需要检查检索到的序列是否满足谓词。这为通过增加检索所需的计算量来扩展难度提供了可能性。具体来说,通过增加谓词的**元数**,我们可以增加其计算复杂度。在我们的例子中,我们测试了元数 1(一元)和元数 2(二元)的谓词。 #### 3.3.2 对抗性诱饵 这里的想法是确保上下文包含几乎满足所需谓词但只有微小偏差的连续子序列。我们实验了两种诱饵变体。 ##### 接近失误诱饵。 对于一元谓词,我们使用**接近失误**诱饵,其中对于 α=0.05 比例的单词,我们随机修改它们使其满足一个谓词。我们对所有谓词都这样做(因此在我们这种情况下,修改的单词总比例为 α⋅k=0.25),同时确保没有两个单词被修改以相似文章
长上下文LLM中的位置失败:推理基准测试的盲点
本论文识别出长上下文LLM推理基准测试中的一个盲点:它们未能控制任务在上下文中的位置,导致位置失败未被检测到。作者提出上下文旋转评估(CRE)来系统地改变任务位置、填充内容和上下文长度,揭示出当推理任务放置在长上下文中时,某些模型的准确率会严重下降。
@lateinteraction: 目前,我认为极少数长上下文基准测试中值得重视的两个是 OBLIQ-Bench…
一位评论者指出,OBLIQ-Bench(recall@k)和 StudyBench(expertise)是少数可靠的长上下文基准测试中的两个。
Long-Horizon-Terminal-Bench:通过密集奖励评分测试智能体在长时程终端任务上的极限
介绍了 Long-Horizon-Terminal-Bench,这是一个包含46个长时程终端任务的基准,采用密集奖励评分,评估AI智能体在规划、长上下文和调试方面的能力。即使是最强模型也仅达到15.2%的pass@1,显示仍有很大的改进空间。
@chenxiao_yang_: 对于更长范围的任务,我们常常考虑使用长上下文模型。但框架也很重要!实际上,它们……
这篇 ICML 论文介绍了递归模型,这些模型递归地调用自身在隔离上下文中解决子任务,证明它们可以在长时推理中超越上下文受限的自回归模型。在 SAT 求解和围棋博弈树搜索上的实验表明,使用较小的活动上下文能提高准确性。
Complexity Ceiling Benchmark:深度缩放下的多领域顺序推理评估
介绍复杂度天花板基准(CCB),该基准评估LLM推理能力随顺序步骤增加而衰减的情况,涵盖三个领域。研究发现一致的每步几何衰减,并且所有模型在传递性社会逻辑中在5步内崩溃,即使整体准确性很高。