ThinkReset:面向有限上下文长程推理的可学习中间接口构建
摘要
本文提出ThinkReset方法,通过构建可复用的中间接口来替代被丢弃的推理历史,从而在受限上下文窗口下实现更好的长程推理。
arXiv:2607.28642v1 公告类型:新论文
摘要:长思维链推理虽然能提升复杂问题的表现,但也带来了冗余累积、上下文溢出和错误锚定等问题。我们认为,在有限的上下文窗口下,核心瓶颈并非轨迹压缩或测试时控制,而是缺乏一个可复用的中间接口来替代被丢弃的历史并支持持续求解。我们进一步指出了结果奖励驱动的长链强化学习中的一个关键失败模式:当模型在窗口即将耗尽前尚未解决问题时,最终答案奖励会促使模型过早猜测,而非继续仔细推理。为此,我们提出ThinkReset,这是上述观点在文本空间中的一种实现。ThinkReset通过接口写回与重置来显式构建可复用的中间接口,并直接优化重置后的继续求解成功率。在多个长程推理基准上,这一思路在固定上下文窗口下持续提升了成功率。
查看缓存全文
缓存时间: 2026/08/03 07:29
# ThinkReset:有界上下文长程推理的可学习中间接口构建 来源:https://arxiv.org/html/2607.28642 Fei Ding1 Yongkang Zhang1 Runhao Liu1 Yuhao Liao2 Zijian Zeng2 1阿里巴巴集团 2清华大学 ###### 摘要 长思维链推理能够提升复杂问题的性能,但也会引入冗余累积、上下文溢出和错误锚定。我们认为,在有界上下文窗口下,核心瓶颈并非轨迹压缩或测试时控制,而是缺少一种可复用的中间接口,用来替代被丢弃的历史并支持继续求解。我们进一步识别出结果奖励驱动的长链强化学习中的一个关键失败模式:当模型在窗口几乎耗尽之前尚未解决任务时,最终答案奖励会鼓励其过早猜测,而非继续谨慎推理。我们提出ThinkReset,作为这一观点在文本空间中的实例化。ThinkReset通过接口回写与重置显式构建可复用中间接口,并直接优化重置后的继续求解成功率。在多个长程推理基准上,这一视角在固定上下文窗口下持续提升了成功率。 (a) 轨迹中心视角 历史持续增长 t1 步骤 错误假设 t2 步骤 t3 步骤 错误锚定 窗口耗尽 被迫截断 (b) 使用ThinkReset进行接口构建 构建可复用接口 t1 步骤 错误假设 t2 步骤 t3 步骤 继续求解 t4′ 可复用中间接口 用于继续求解 [RESET] 替换原始历史 图1:有界上下文窗口下的轨迹保留与接口构建对比。ThinkReset不是继续增长自回归历史,而是用一个可复用的中间接口替换历史,以支持继续求解。 ## 1 引言 大语言模型在复杂推理上取得了长足进步,从思维链提示到近期基于强化学习训练的大规模推理模型(Wei et al., 2022 (https://arxiv.org/html/2607.28642#bib.bib21); Guo et al., 2025 (https://arxiv.org/html/2607.28642#bib.bib4); Yang et al., 2025 (https://arxiv.org/html/2607.28642#bib.bib24); Team et al., 2025 (https://arxiv.org/html/2607.28642#bib.bib18))。然而,其长程性能仍受制于一个被低估的因素:中间状态在上下文窗口内如何管理。随着推理轨迹增长,模型不仅要面对有限的上下文容量,还要应对冗余累积、持续存在的错误假设,以及尚未完成的求解过程被截断的问题;现有工作通常通过压缩、剪枝或对推理轨迹进行测试时控制来处理这些失败(Xia et al., 2025 (https://arxiv.org/html/2607.28642#bib.bib23); Pan et al., 2024 (https://arxiv.org/html/2607.28642#bib.bib13); Hou et al., 2026 (https://arxiv.org/html/2607.28642#bib.bib7); Wu et al., 2026 (https://arxiv.org/html/2607.28642#bib.bib22))。我们认为,这种当前常见的框架仍然不完整。 大多数先前方法隐式地采用了轨迹中心视角:推理被视为一条不断增长的自回归轨迹,主要设计问题变为如何更有效地保留、压缩或干预这条轨迹。然而,在有界上下文窗口下,更根本的问题不是轨迹是否更短或调度得更好,而是模型能否构建一个新的中间接口,使其既能替代被丢弃的历史,又能继续支持问题求解。这引出了我们的核心论点: > 有界上下文长程推理本质上是一个中间接口学习问题:关键不仅在于控制或压缩推理轨迹,而在于构建一个可复用的中间接口,以支持继续求解。 这一重新表述将核心对象从完整轨迹转向可复用中间接口,并将优化目标从局部保真度或轨迹控制转向该接口是否真正支持继续求解。 同样的问题也出现在近期长链推理系统的训练目标层面(Guo et al., 2025 (https://arxiv.org/html/2607.28642#bib.bib4); Yang et al., 2025 (https://arxiv.org/html/2607.28642#bib.bib24); Team et al., 2025 (https://arxiv.org/html/2607.28642#bib.bib18))。在结果奖励驱动的长链强化学习中,监督信号通常只在最终答案处给出,并未显式建模模型是否仍保有继续求解的能力。当上下文窗口固定,且窗口填满时问题仍未完成,训练信号会逐渐从仔细推理转向在剩余上下文内尽快给出答案。结果是,模型可能在窗口接近耗尽时放弃详细推理,直接跳到一个猜测。尽管近期工作越来越关注高效推理和过度思考的缓解(Xia et al., 2025 (https://arxiv.org/html/2607.28642#bib.bib23); Sui et al., 2025 (https://arxiv.org/html/2607.28642#bib.bib15)),这并不仅仅是一个长度问题或一般性的稀疏奖励问题。其根源在于,当前目标并未将可复用、可求解的中间接口作为显式优化目标。只要模型只被训练来关注完整轨迹或最终答案,它就没有多少动力去构建一个能够替代历史并继续支持未来推理的状态。因此,这一失败模式暴露了有界上下文长程推理与现有训练目标之间的结构性错配。 这也是我们不把方法重心放在局部保真度或长度代理上的原因。对于长程推理,关键问题不在于重写后的状态能否逐 token 重建原始轨迹,而在于它能否保留足够的问题求解能力,以便在重置后取得进展。因此,我们将中间接口本身视为一个显式的可训练对象,并直接针对其支持后续推理的能力进行优化。 为此,我们提出一个可学习的重写框架,其中中间状态不被视为历史的复述,而是一个显式的可训练对象。系统可以在合适时机主动构建这样的状态,替换此前较长的轨迹,并从中继续推理。核心问题不再是尽可能多地保留轨迹,而是如何学习一个足以支持继续求解的接口。为实例化这一框架,我们引入了ThinkReset。在固定上下文窗口下,ThinkReset在上下文占用达到阈值时触发接口回写,生成新的中间状态,并用它替换前面的长轨迹。我们不是优化局部重建、长度惩罚或其他间接代理,而是直接优化重置后的继续求解成功率。因此,中间接口本身即是优化目标。相应地,ThinkReset不应仅被理解为一种长度控制机制或测试时调度启发式,而是从轨迹保留转向接口构建这一转变的具体实现。在有界上下文窗口下,长程推理的提升来自学习可复用中间接口,而不仅仅是修剪、保留或重新调度原始轨迹。 #### 贡献。 我们的主要贡献如下: - **问题重新表述**。我们将有界上下文长程推理重新表述为*中间接口学习问题*。核心挑战不是保留完整推理轨迹,而是学习一个能够替代历史并支持继续求解的可复用接口。 - **统一视角**。我们通过缺失中间接口来解释冗余累积、上下文溢出和错误锚定。这些不是孤立的失败,而是模型无法构建、更新和复用有效接口的不同表现。 - **方法实例化**。我们提出ThinkReset作为这一观点在文本空间中的实例化。与轨迹保留方法不同,ThinkReset将可复用中间接口视为显式、可训练的对象,并通过文本空间中的接口回写与重置来学习它们。 - **训练动态分析**。我们识别出固定上下文窗口下结果奖励驱动的长链强化学习的一个关键失败模式:如果模型在窗口耗尽前未解决任务,最终答案奖励会促使其放弃详细推理而进行猜测。这表明当前目标并未针对可复用、可求解的中间接口进行优化。 - **优化目标**。我们不将训练重点放在轨迹保真度或基于长度的代理指标上,而是直接优化重置后的*继续求解成功率*,使目标与接口构建对齐。 - **实证验证**。在多个长程推理基准上,在固定上下文窗口下学习可复用中间接口持续提升了成功率和推理稳定性。 ## 2 相关工作 #### 从轨迹保留到接口构建。 我们将有界上下文长程推理重新理解为中间接口学习问题。从这个视角看,大多数先前工作可以被理解为追求*轨迹保留*:推理轨迹,无论是完整还是部分的,仍然是需要保留、压缩、调度或刷新的主要对象。在这些方法中,中间状态通常通过剪枝、重编码、调度或外部管理从轨迹中衍生而来,而不是被作为显式接口进行学习。相比之下,我们关注*接口构建*。核心对象不是原始轨迹本身,而是一个可训练的中间接口,其价值在于替代历史的同时仍支持后续推理。这一区别为组织相关工作提供了一种统一方式。 #### 轨迹压缩与长度控制。 长思维链推理通常能提升复杂任务的性能,但也带来上下文溢出和过度思考问题(Wei et al., 2022 (https://arxiv.org/html/2607.28642#bib.bib21); Guo et al., 2025 (https://arxiv.org/html/2607.28642#bib.bib4); Yang et al., 2025 (https://arxiv.org/html/2607.28642#bib.bib24); Team et al., 2025 (https://arxiv.org/html/2607.28642#bib.bib18); Qu et al., 2025 (https://arxiv.org/html/2607.28642#bib.bib14); Sui et al., 2025 (https://arxiv.org/html/2607.28642#bib.bib15); Chen et al., 2026 (https://arxiv.org/html/2607.28642#bib.bib2); Ma et al., 2025 (https://arxiv.org/html/2607.28642#bib.bib12))。代表性方法通过剪枝、重编码或选择性保留轨迹来缓解上下文限制,包括TokenSkip(Xia et al., 2025 (https://arxiv.org/html/2607.28642#bib.bib23))、LLMLingua-2(Pan et al., 2024 (https://arxiv.org/html/2607.28642#bib.bib13))、步熵压缩(Li et al., 2026a (https://arxiv.org/html/2607.28642#bib.bib8))、ThinkPrune(Hou et al., 2026 (https://arxiv.org/html/2607.28642#bib.bib7))、R1-Compress(Wang et al., 2025 (https://arxiv.org/html/2607.28642#bib.bib20))和Extra-CoT(Tang et al., 2026 (https://arxiv.org/html/2607.28642#bib.bib17))。在我们的分类中,这些方法都属于轨迹保留方法:它们考虑的是在有限窗口下如何保留更多轨迹,而ThinkReset关注的是用于继续求解的接口构建。 #### 潜变量与状态表示学习。 一些工作通过潜变量或压缩状态表示来减轻上下文负担,例如CoLaR(Tan et al., 2025 (https://arxiv.org/html/2607.28642#bib.bib16))、COCONUT(Hao et al., 2025 (https://arxiv.org/html/2607.28642#bib.bib5))和LightThinker(Zhang et al., 2025 (https://arxiv.org/html/2607.28642#bib.bib26))。这些方法在一定程度上脱离了显式轨迹保留,但其表示往往可解释性较弱,并且很少被训练为直接支持未来求解的可复用接口。ThinkReset则完全在文本空间中运作:它既不引入潜在头,也不引入额外的压缩单元,而是将接口本身作为后续推理的上下文入口。因此,我们的重点不是用更少的显式历史来保留同一过程,而是接口能否支撑持续求解。 #### 运行时上下文刷新与状态管理。 在多轮交互和智能体系统中,将不断增长的历史转换为分阶段状态是常见做法;相关例子包括ReSum(Wu et al., 2026 (https://arxiv.org/html/2607.28642#bib.bib22))、Metacognitive Reuse(Didolkar et al., 2025 (https://arxiv.org/html/2607.28642#bib.bib3))和Pensieve / StateLM(Liu et al., 2026 (https://arxiv.org/html/2607.28642#bib.bib10))。这些方法主要针对对话历史、搜索或外部记忆管理。ThinkReset在思想上最为接近,但范围更窄:它不管理对话或工具调用,而只关注单条推理轨迹内部的重置。关键区别在于,我们将固定窗口重置与可复用接口构建联合建模,并通过重置后的继续求解成功率直接训练接口。 #### 递归框架、测试时控制器与运行时刷新。 近期工作也在研究更强的执行框架和运行时级上下文管理。递归推理框架将子任务放入隔离的上下文中,并具有显式的调用-返回结构,可以提供形式化的活动上下文节省保证(Yang et al., 2026 (https://arxiv.org/html/2607.28642#bib.bib25))。Halo代表一种测试时控制器,它使用熵信号在推理边界附近调整规划,而不是学习回写状态本身(Li et al., 2026b (https://arxiv.org/html/2607.28642#bib.bib9))。COMPASS通过主智能体、元认知规划器和上下文管理器将上下文管理提升到智能体层面(Wan et al., 2025 (https://arxiv.org/html/2607.28642#bib.bib19))。TIM/TIMRUN根据任务相关性执行运行时KV剪枝(Luo et al., 2025 (https://arxiv.org/html/2607.28642#bib.bib11))。与这些方法相比,ThinkReset更窄、更直接:它既不修改执行引擎,也不依赖自适应的不稳定驱动控制,而是在普通自回归文本轨迹内部学习可复用中间接口。因此,我们的贡献不是更强的上下文管理理论,而是证明可复用中间接口本身可以在纯文本空间中被训练,并提升重置后的继续求解成功率。 #### 我们方法的位置。 与上述工作路线不同,我们不将问题核心放在保留或灵活调度轨迹上。我们转而追问:如何学习一个能够替代历史并仍支持继续求解的中间接口。就此而言,ThinkReset不是剪枝或控制的简单变体,而是对界上下文长程推理核心优化对象的不同表述:从轨迹保留转向接口构建。 ## 3 ThinkReset方法 ### 3.1 机制概述 我们将有界上下文长程推理视为一个*中间接口学习*问题。在固定上下文窗口`C`下,挑战不在于如何尽可能多地保留轨迹,而在于如何构建一个可复用接口,使得在移除原始历史后仍能支持求解。因此,ThinkReset的目标不是延长轨迹……
相似文章
平衡思考的高效推理
本文介绍了ReBalance,一种无需训练、即插即用的方法,能够动态平衡大型推理模型中的过度思考与思考不足,在多个基准测试中提升效率与准确性。
结构化思维:改进推理与上下文剪枝
本文介绍了结构化思维(Structured Thoughts),这是一个将大语言模型推理过程组织成交替的<try>和<outcome>块的框架,实现了上下文剪枝,并在推理基准测试上将性能提升高达8.08%,同时节省了85%的内存。
RRM:经验驱动的反思性检索记忆用于长时程多模态推理
本文介绍了反思性检索记忆(RRM),一种记忆框架,从历史任务轨迹中提炼程序性检索经验,以改进长时程多模态推理中的证据检索。RRM在M3-Bench-Robot、M3-Bench-Web和Video-MME-Long基准上达到或超过了先前的最先进水平。
学习何时停止有用?推理模型早期退出的成本感知研究
本文介绍了LearnStop,一种用于推理模型的轻量级检查点停止器,它从在线特征中预测前缀正确性,并发现学习式停止仅在多个问题早期正确且没有单一可靠的标量信号时,才比标量规则更有价值。
抗泄漏机器遗忘:评估多跳推理一致性与恢复鲁棒性的新基准
本文介绍了一个用于评估机器遗忘的新基准,重点关注多跳推理一致性和恢复鲁棒性。实验表明,现有遗忘方法在遗忘质量、鲁棒性和效用保持之间面临“不可能三角”的权衡。