@dair_ai: // ReContext // 模型现已支持128K上下文窗口,但仍无法利用提示中已有的证据。W…
摘要
ReContext 是一种新的免训练推理方法,通过利用模型内部的相关性信号构建查询条件化的证据池,并在最终生成前重放该证据池,从而改进长上下文推理。在 Qwen3 和 Llama3 模型的八个 128K 上下文数据集上取得了最佳平均排名。
查看缓存全文
缓存时间: 2026/07/06 18:09
// ReContext // 模型现已支持 128K 上下文窗口,但仍无法利用提示词中已有的证据。差距在哪里?新论文提出 ReContext,一种免训练的长上下文推理推理框架。它利用模型内部的关联信号构建查询条件化的证据池,然后在最终生成前重放该证据池,同时保留完整的原始上下文。无需训练,无需外部记忆,无需剪枝。上下文充当记忆存储,问题充当检索线索,注意力充当线索-痕迹关联,重放充当痕迹再激活。横跨八个 128K 长上下文数据集,ReContext 在 Qwen3-4B、Qwen3-8B 和 Llama3-8B 上均提升了证据利用率,在所有三个主干上取得最佳平均排名。代码已开源。论文:https://arxiv.org/abs/2607.02509 在我们的学院中学习构建有效的 AI 代理:https://academy.dair.ai — # 递归证据重放:长上下文推理的 LLM 支架 来源:https://arxiv.org/html/2607.02509 Yanjun Zhao¹†平等贡献†通讯作者,Ruizhong Qiu¹†平等贡献†通讯作者,Tianxin Wei¹†平等贡献†通讯作者,Yuanchen Bei,Zhining Liu,Lingjie Chen,Ismini Lourentzou,Hanghang Tong,Jingrui He† 伊利诺伊大学厄巴纳-香槟分校 {yanjunzh, jingrui}@illinois.edu ###### 摘要 理解和推理长上下文已成为在现实应用中部署大型语言模型(LLM)的关键需求。尽管近期 LLM 支持越来越长的上下文窗口,但它们常常无法利用输入中已有的相关证据,暴露出上下文访问与有效上下文利用之间的差距。在本文中,我们提出递归证据重放:长上下文推理的 LLM 支架(ReContext),一种免训练的长上下文推理推理方法。ReContext 使用模型内部的关联信号构建查询条件化的证据池,并在最终生成前重放该证据池,同时保留完整的原始上下文。这种递归选择过程将证据组织与答案生成分离,无需训练、外部记忆或上下文剪枝。我们还基于联想记忆提供了理论分析,将上下文刻画为记忆存储,问题为检索线索,注意力为线索-痕迹关联,重放为痕迹再激活。在八个 128K 上下文长度的长上下文数据集上的实验表明,ReContext 在 Qwen3-4B、Qwen3-8B 和 Llama3-8B 上持续提升证据利用率,在所有三个主干上取得最佳平均排名。代码见 https://github.com/Yanjun-Zhao/ReContext。 ReContext:递归证据重放作为长上下文推理的 LLM 支架 参见图注 图 1:上下文 token 的前 0.1% 已占三个 LLM 累计关联分数的约 50% / 80%,对应于 128K token 上下文中仅 128 个 token。该图将所有上下文 token 按与问题相关的关联分数排序,并显示排名靠前的 token 覆盖了多少累计关联分数。每条曲线代表八个数据集的平均趋势,阴影区域显示数据集间的方差。## 1 引言 长上下文大型语言模型(LLM)现在可以将整个文档、多文档集合和扩展对话放入单个提示词中。然而,更长的上下文窗口并不能保证可靠的长上下文推理。一个反复出现的失败模式是:回答某个问题所需的证据已经存在于输入中,但模型在生成过程中并未始终如一地使用它(Yen 等,2025(https://arxiv.org/html/2607.02509#bib.bib25); Ye 等,2026(https://arxiv.org/html/2607.02509#bib.bib35); Bei 等,2026(https://arxiv.org/html/2607.02509#bib.bib13))。这表明瓶颈不仅在于上下文访问,更在于上下文驾驭:我们需要一种机制,在推理过程中动态管理长上下文,持续识别、组织和更新与当前阶段最相关的信息,从而实现更扎实、更高效的长上下文推理。 参见图注 图 2:ReContext 概览。ReContext 利用 LLM 内部关联信号从长上下文中识别与问题相关的证据,将选中的 token 具体化为有依据的证据片段,并在最终生成前递归重放这些证据片段,同时保留对完整上下文的访问。标准的长上下文提示要求模型在单次推理过程中阅读上下文并回答查询。随着上下文增长,证据必须与越来越多的无关信息竞争,使模型更难将其答案扎根,从而导致错误或幻觉(Li 等,2024(https://arxiv.org/html/2607.02509#bib.bib18); Liu 等,2025(https://arxiv.org/html/2607.02509#bib.bib38))。近期工作从不同角度解决该问题:注意力干预方法修改底层模型行为(Li 等,2024(https://arxiv.org/html/2607.02509#bib.bib18); Tang 等,2024(https://arxiv.org/html/2607.02509#bib.bib16); Ye 等,2026(https://arxiv.org/html/2607.02509#bib.bib35)),但这种方法是侵入性的,因为需要更改主干的前向或解码逻辑。检索和外部记忆方法添加检索系统(Lewis 等,2021(https://arxiv.org/html/2607.02509#bib.bib23); Xu 等,2025(https://arxiv.org/html/2607.02509#bib.bib36)),而压缩方法缩短有效输入(Jiang 等,2023(https://arxiv.org/html/2607.02509#bib.bib21),2024(https://arxiv.org/html/2607.02509#bib.bib20); Zhao 等,2025c(https://arxiv.org/html/2607.02509#bib.bib37)),这两种方法通常依赖检索、压缩或 LLM 总结的证据视图,可能会丢失细粒度细节,并且在复杂的多跳任务上可能不稳定。这表明上下文支架不应局限于检索或减少输入。相反,在保留对原始输入完整访问的同时,它应根据当前推理阶段动态查询并维护一个支持性证据库,帮助模型在长上下文中进行高质量推理。我们提出递归证据重放:长上下文推理的 LLM 支架(ReContext),一种免训练的长上下文推理推理方法。给定长上下文和问题,ReContext 读取原始提示,使用查询条件化的内部注意力作为候选证据提案,将选中的 token 具体化为有依据的文本片段,并在最终答案生成前重放这些片段。如图 1 所示,128K token 上下文中的 128 个 token 已占查询条件化累计相关性的约 50–80%。ReContext 将这些稀疏信号转化为证据池:经过少数几轮迭代,ReContext 通过将每个新选择步骤条件化于原始上下文、问题和迄今累积的证据池来更新一个有序证据池。该支架在迭代流程中充当临时外部工作空间,这就是我们将 ReContext 视为在完整上下文阅读与最终生成之间的 LLM 支架的原因。重放的支架改变了模型状态,从而影响下一轮查询 token 注意力分数的计算,使得后续轮次能够浮现与先前选取片段相关的证据。完整上下文保留在提示词中;证据池用于强调,而非排除。我们在此限制性推理意义上使用“递归”:每个证据提案依赖于前几轮产生的证据池,而非开放式的推理循环。我们进一步从联想记忆的角度为 ReContext 提供理论洞见。长上下文可视为记忆存储,问题作为检索线索,注意力作为线索-痕迹关联的提示内部代理,重放作为在生成时附近再激活选中的痕迹。这一观点得出了一个单调改进证明,表明递归证据重放可以将隐藏表示移向答案嵌入,并将 ReContext 定位为利用内部关联信号进行的查询-证据重新绑定,而非经过训练的检索器或上下文剪枝。综上所述,我们工作的贡献如下: - •我们提出递归证据重放支架(ReContext),一种免训练的方法,将提示内部关联信号转化为显式的递归证据池,同时保留完整上下文。 - •我们为 ReContext 提供了联想记忆解释和一个单调改进证明,将证据选择形式化为线索-痕迹关联,将重放形式化为痕迹再激活以进行查询-证据重新绑定。 - •我们在 Qwen3-4B、Qwen3-8B 和 Llama3-8B 上对八个 128K 长上下文数据集进行了评估,ReContext 在所有三个主干上取得最佳平均排名,并将平均准确率从 Vanilla 的 0.24 提升至 0.30,相对提升24.6%。 ## 2 相关工作 ### 2.1 长上下文利用与证据引导推理 近期工作通过位置外推、高效注意力机制和长上下文微调显著扩展了大型语言模型的上下文窗口(Peng 等,2023(https://arxiv.org/html/2607.02509#bib.bib1); Chen 等,2024(https://arxiv.org/html/2607.02509#bib.bib32); Ding 等,2023(https://arxiv.org/html/2607.02509#bib.bib33),2024(https://arxiv.org/html/2607.02509#bib.bib31))。伴随这些建模进展,一系列基准被提出,用于评估不同场景下的长上下文能力,包括文档问答、多文档推理、检索、摘要、代码补全和合成压力测试(Bai 等,2024(https://arxiv.org/html/2607.02509#bib.bib30); Shaham 等,2023(https://arxiv.org/html/2607.02509#bib.bib29); An 等,2023(https://arxiv.org/html/2607.02509#bib.bib28); Zhang 等,2024(https://arxiv.org/html/2607.02509#bib.bib27); Hsieh 等,2024(https://arxiv.org/html/2607.02509#bib.bib26); Yen 等,2025(https://arxiv.org/html/2607.02509#bib.bib25))。这些研究表明,长上下文评估不仅应衡量模型是否能够接受长输入,还应衡量其是否能定位并利用隐藏在长上下文中的相关信息。然而,仅增加上下文窗口并不能保证有效的上下文利用。先前分析表明,LLM 对相关证据的位置敏感,当信息出现在提示中不太有利的位置时,可能无法使用该信息(Liu 等,2023a(https://arxiv.org/html/2607.02509#bib.bib24))。为解决此问题,检索增强生成在生成前检索相关段落(Lewis 等,2021(https://arxiv.org/html/2607.02509#bib.bib23)),而提示和上下文压缩方法通过过滤、剪枝或压缩信息量较少的内容来缩短输入长度(Li 等,2023(https://arxiv.org/html/2607.02509#bib.bib22); Jiang 等,2023(https://arxiv.org/html/2607.02509#bib.bib21),2024(https://arxiv.org/html/2607.02509#bib.bib20))。另一类工作通过 KV 缓存压缩或 token 驱逐来提高推理效率(Liu 等,2023b(https://arxiv.org/html/2607.02509#bib.bib10); Zhang 等,2023(https://arxiv.org/html/2607.02509#bib.bib19); Xiao 等,2024(https://arxiv.org/html/2607.02509#bib.bib11))。 ### 2.2 内部注意力信号与基于记忆的解释 另一个相关方向研究 LLM 内部的 token 级重要性。先前的工作观察到,长上下文推理中的注意力模式通常高度结构化:少数 token 可能充当重击者、注意力沉没或显著键位置,对未来注意力计算贡献不成比例(Liu 等,2023b(https://arxiv.org/html/2607.02509#bib.bib10); Zhang 等,2023(https://arxiv.org/html/2607.02509#bib.bib19); Xiao 等,2024(https://arxiv.org/html/2607.02509#bib.bib11))。基于此观察,近期方法选择或保留重要的 KV 缓存 token,以提高推理效率同时保持模型性能(Li 等,2024(https://arxiv.org/html/2607.02509#bib.bib18); Cai 等,2025(https://arxiv.org/html/2607.02509#bib.bib17); Tang 等,2024(https://arxiv.org/html/2607.02509#bib.bib16); Feng 等,2025(https://arxiv.org/html/2607.02509#bib.bib12))。这些研究表明,模型内部信号可以提供关于哪些上下文 token 重要的有用信息。我们的工作与此研究方向相关,但目标不同。ReContext 并非提出新的 token 重要性估计器或 KV 缓存压缩策略,而是利用现有的查询到上下文关联信号来构建有依据的候选证据片段,并研究重放这些片段如何改进长上下文答案生成。选中的证据是查询条件化的,根据其与当前问题的相关性而非对维护缓存的普遍贡献来选择。这种对关联信号的使用也支持联想记忆解释:选中的片段被视为与查询关联的上下文痕迹,并在生成前重放。经典和现代联想记忆模型利用部分或有噪声的线索检索存储的模式,近期研究将 Transformer 注意力与记忆检索机制联系起来(Ramsauer 等,2021(https://arxiv.org/html/2607.02509#bib.bib15); Krotov 等,2025(https://arxiv.org/html/2607.02509#bib.bib14))。 ## 3 方法 表 1:长上下文任务上的主要基准比较。ReContext 在所有三个主干上取得最佳平均排名,在数据集和模型规模上显示了持续增益。深色和浅色背景分别表示每个主干中的最佳和次佳结果。### 3.1 概述 给定长上下文 (C) 和问题 (q),标准长上下文 LLM 直接从 ([C; q]) 生成。递归证据选择的上下文支架(ReContext)则分离证据组织与答案生成。它首先读取原始提示,利用查询条件化的内部关联信号提取候选证据片段,将这些片段作为证据池重放,然后根据完整上下文、证据池和问题生成最终答案。该方法不剪枝提示,也不在最终解码时直接修改注意力 logits。原始上下文在整个生成过程中保持可用。重放的支架强调候选证据,并使证据利用变得显式,同时保持未选中的上下文可访问。ReContext 维护一个有序证据池,并在固定的小轮数内更新它。每一轮从已经包含前几轮累积证据池的提示中计算关联分数。 ### 3.2 证据选择 令 (M) 表示主干 LLM。对于当前提示 (x),令 (\mathcal{I}{x}) 表示 (x) 中的 token 位置,并令 (\mathcal{I}{C} \subseteq \mathcal{I}{x}) 表示属于原始上下文 (C) 的位置。令 (\mathcal{Q}(x) = (t{1}, \ldots, t_{L})) 为提示后缀中的最后 (L \leq w) 个线索位置,其中在主要实验中 (w=8)。这些后缀线索提供查询条件化的读出,并在后续轮次中
相似文章
@chenxiao_yang_: 对于更长范围的任务,我们常常考虑使用长上下文模型。但框架也很重要!实际上,它们……
这篇 ICML 论文介绍了递归模型,这些模型递归地调用自身在隔离上下文中解决子任务,证明它们可以在长时推理中超越上下文受限的自回归模型。在 SAT 求解和围棋博弈树搜索上的实验表明,使用较小的活动上下文能提高准确性。
RECON:面向长上下文组合推理的智能体记忆基准测试
介绍RECON,一个用于评估基于LLM的智能体在长上下文中组合推理能力的基准测试,涵盖刑事、医疗和金融领域的24个案例文件。最佳非Oracle系统仅达到22.4%的准确率,揭示了当前记忆架构的严重局限性。
@ickma2311: 高效AI讲座15:长上下文LLM 长上下文不仅仅是更大的提示窗口。关键问题是:哪些过…
本文总结了关于长上下文LLM的高效AI讲座15,涵盖用于上下文扩展的RoPE位置插值、大海捞针评估,以及StreamingLLM的注意力汇聚现象和KV缓存驱逐策略。
Deepseek V4的百万上下文窗口:临界点
对Deepseek V4在多个生产代码库上的百万token上下文窗口的详细评估显示,在150-250k token时性能最佳,超过300k后性能下降,推理模式下延迟显著。该模型在未知任务上表现出较高的幻觉率,生产环境中需要验证层。
@simplifyinAI:微软刚刚解决了上下文窗口难题
微软刚刚解决了上下文窗口难题。目前,所有 AI 都存在致命短板:上下文窗口问题。当 AI 推理复杂问题时,会生成极长的思维链,但问题是它必须把每一个 token 都保留下来。