记忆并非总是必需:科学推理中条件记忆的刻画
摘要
本文研究了条件记忆在科学推理语言模型中的作用,引入了一个Knowledge Boundary-Aware Router,以根据任务特定输入动态激活记忆,从而提升性能并避免干扰。
arXiv:2608.23982v1 Announce Type: new
摘要:科学推理要求语言模型检索专业知识并将其可靠地整合到多步计算中。条件记忆提供了一个显式的查找途径,补充密集神经表示,但其效用本质上取决于输入和计算:检索到的信息可能修复缺失的科学关联,但也可能引入干扰性的捷径或干扰基础模型已经能够正确执行的推理。本文系统地研究了条件记忆在科学推理中何时、何处以及在多大程度上应该参与。我们刻画了科学知识边界以及对启用记忆的知识电路节点的控制干预。基于这些分析,我们提出了一个Knowledge Boundary-Aware Router,它使用生成前可用的任务特定输入代理来确定是否激活记忆、哪些层阶段节点接收记忆信号以及这些信号的贡献强度。在生物和化学推理基准上的实验,涵盖两种骨干架构和六种任务类型,表明记忆效果在输入、任务和注入位置之间存在显著差异。与静态和激活率匹配的随机路由相比,我们的方法更一致地保留有益的记忆贡献,同时抑制记忆引起的退化,确立选择性记忆分配作为可靠科学推理的重要原则。
查看缓存全文
缓存时间: 2026/08/26 09:19
# 表征科学推理中的条件记忆 来源:https://arxiv.org/html/2608.23982 陈学书¹* 王燕² 彭志志² 洪浩森² 王真² 朱秉宇² 卢俊刚¹† ¹湖州师范学院,²阿里巴巴集团,³博泰生物科技,⁴浙江大学 [email protected] ###### 摘要 科学推理要求语言模型检索专业知识并将其可靠地融入多步计算中。条件记忆提供了一条显式的查询路径,作为稠密神经表征的补充,但其效用本质上依赖于输入和计算:检索到的信息可能修复缺失的科学关联,但也可能引入干扰性捷径或干扰基础模型已能正确执行的推理。本工作系统地研究了条件记忆在科学推理中何时、何处以及在多大程度上应参与其中。我们刻画了科学知识边界,并对启用记忆的知识电路节点进行受控干预。基于这些分析,我们提出了一个知识边界感知路由器,该路由器利用生成前可用的任务特定输入代理,来决定是否激活记忆、哪些层-阶段节点接收记忆信号,以及这些信号的贡献强度如何。在生物和化学推理基准上的实验,涵盖两个骨干家族和六种任务类型,表明记忆效应在输入、任务和注入位置上存在显著差异。与静态和激活率匹配的随机路由相比,我们的方法能更一致地保留有益的记忆贡献,同时抑制记忆引起的性能退化,确立了选择性记忆分配作为可靠科学推理的重要原则。 ¹湖州师范学院,²阿里巴巴集团,³博泰生物科技,⁴浙江大学 ## 1 引言 科学发现日益需要模型对复杂的生物、化学、物理和数学系统进行推理 (Jablonka et al. 2024; Ross et al. 2022; Merchant et al. 2023; Boiko et al. 2023; Romera-Paredes et al. 2024)。因此,提升大型语言模型的科学推理能力对于可靠的科学分析和发现至关重要 (Wei et al. 2025)。其核心在于,模型不仅需要获取专业知识,还需在多步推理中忠实地整合这些知识。 **图注 图1:** 左:条件记忆是一种模型内部的查询-注入机制:记忆模块被置于 Transformer 计算中。右:即使在知识密集型的科学推理任务上,记忆也产生混合效应而非均匀提升,这促使了选择性激活的研究。 现有方法主要依赖领域专用模型或检索增强生成 (Zhang et al. 2024; Wen et al. 2024; Team, Peng, and Qiao 2025; Guu et al. 2020)。尽管它们存储知识的方式不同,但都缺乏知识查询与神经计算之间的明确分离。条件记忆提供了一种互补的查询路径 (Cheng et al. 2026),对于知识密集型的科学推理尤其有前景,因为其中专业实体、基序、结构和规则频繁重现。近期研究已将条件记忆应用于基因组基础模型和分子语言模型,报告了显式查询生物基序和分子模式带来的好处 (Xu et al. 2026; Zhang et al. 2026)。然而,这些结果仍局限于特定的科学场景,并未确立记忆应在更广泛的科学推理中均匀激活的观点。在异构任务中,记忆可能在某一案例中修复缺失的科学关联,在另一案例中收效甚微,或引入误导性捷径从而破坏本应正确的推理路径(如图1所示)。因此,其效用必须相对于无记忆基础模型的知识边界以及记忆注入的计算位置来评估。 因此,在本研究中,我们探讨了**条件记忆何时是科学推理可行的计算机制**,并通过科学知识边界系统地研究其影响。具体而言,通过行为知识边界分析和受控的层-阶段干预,我们表明记忆效用同时取决于输入、注入位置和贡献强度。这些发现促成了一个**知识边界感知路由器**,该路由器利用任务特定的输入代理来决定记忆是否参与、在何处参与以及参与强度如何,揭示了选择性记忆分配是科学推理模型更广泛的设计原则。 我们的贡献有三方面: - • 我们对科学推理中的条件记忆进行了系统的实证研究,涵盖生物和化学领域、两个骨干家族和六种任务类型。我们表明记忆是一种可行但本质上非均匀的增强:它修复了一些科学推理失败,同时在其他情况下引发了退化。 - • 我们通过行为能力边界指标和层-阶段记忆干预刻画了这种异质性,揭示了记忆效用取决于输入范围及其在推理计算中的位置。 - • 我们将这些发现转化为一种边界感知路由机制,该机制利用任务特定的输入代理选择性激活记忆。该路由器优于激活率匹配的随机路由,并避免了静态记忆配置引起的若干退化。 **图注 图2:** 我们工作概览。我们从两个互补视角(行为视角和知识电路视角)分析问题。然后我们提出了**条件记忆的知识边界感知路由**(外部边界感知数据路由器和内部边界感知参数路由器)。 ## 2 相关工作 ### 2.1 基于条件记忆的大语言模型 记忆增强的大语言模型通过选择性访问的存储来补充稠密参数。稀疏键值层扩展了容量 (Lample et al. 2019),而基于查询的条件记忆(由 Engram 实例化)则使用后缀 n-gram 查找作为互补的稀疏性轴 (Cheng et al. 2026)。记忆专家架构通过令牌级记忆专家注入预存储的知识 (Ding et al. 2026),而数据存储方法则检索目标、段落或相邻块 (Khandelwal et al. 2020; Lewis et al. 2020; Borgeaud et al. 2022)。基于激活的记忆重用缓存的历时状态 (Wu et al. 2022; Wang et al. 2023)。可写系统进一步支持对话回忆、情景记忆或部署后更新,以及可扩展的稀疏记忆 (Yuan et al. 2023; Das et al. 2024; Wang et al. 2024b; Berges et al. 2025)。现有工作强调总体增益,而我们研究的是记忆在科学边界处何时被需要以及因果有效。 ### 2.2 科学推理知识边界 科学推理基准涵盖了广泛的STEM知识、专业问题解决和定理应用 (Hendrycks et al. 2021; Wang et al. 2024a; Rein et al. 2023; Chen et al. 2023)。领域特定模型、基准和综述进一步涵盖了中文生物医学语言理解 (Zhang et al. 2022b)、结合基因本体知识的蛋白质表示学习 (Zhang et al. 2022a)、海洋科学任务 (Bi et al. 2024) 以及医疗大语言模型技术与应用 (Hu et al. 2025)。然而,最终答案的正确性无法区分知识缺口与错误推导。过程级反馈和奖励模型揭示了中间错误 (Uesato et al. 2022; Lightman et al. 2024)。不确定性研究探究自我评估和引出的置信度 (Kadavath et al. 2022; Xiong et al. 2024),而采样响应分歧和语义熵则揭示了重复推理的不稳定性 (Manakul, Liusie, and Gales 2023; Farquhar et al. 2024)。我们将这些信号综合为最终答案失败、推理步骤失败和重复推理不稳定性,以刻画基础模型在条件记忆分析中的科学推理边界。 ## 3 科学知识边界处的条件记忆 本节从两个互补视角分析问题。行为视角识别**输入何时**达到基础模型的知识边界:最终答案失败、推理步骤失败和预测不稳定分别暴露了错误结果、有缺陷的推导和不可靠的重复推理。知识电路视角识别**记忆可在何处**影响计算:隐藏状态查询存储,检索到的值通过选定层和阶段的本征门进行注入。 ### 3.1 行为科学知识边界刻画 我们在无记忆的基础模型上评估记忆,因为它可能修复缺失的关联,也可能破坏原本充分的推理。记忆效用因输入而异。对于每个样本 \(x_i\),我们相对于无记忆骨干模型 \(M_{\mathrm{base}}\) 定义行为边界码。给定任务级答案评估器 \(E_{\mathrm{ans}}\)、过程级评估器 \(E_{\mathrm{step}}\) 和重复推理一致性分数 \(C_i\),我们计算: \[b_{i}^{A}=\mathbf{1}\left[E_{\mathrm{ans}}\left(M_{\mathrm{base}}\left(x_{i}\right),y_{i}\right)<\tau_{A}\right],\] \[b_{i}^{R}=\mathbf{1}\left[E_{\mathrm{step}}\left(M_{\mathrm{base}}\left(x_{i}\right),y_{i}\right)<\tau_{R}\right],\] \[b_{i}^{P}=\mathbf{1}\left[C_{i}<\tau_{P}\right].\] 这里 \(b_{i}^{A}\), \(b_{i}^{R}\), 和 \(b_{i}^{P}\) 分别标记最终答案失败、推理步骤失败和预测不稳定。我们将它们编码为 \(\mathbf{q}_{i}=\left(b_{i}^{A},b_{i}^{R},b_{i}^{P}\right)\in\{0,1\}^{3}\)。 这些指标是非互斥的:一个输入可能尽管推导有误但最终答案正确,可能稳定地错误,或可能尽管有一个正确样本但整体不稳定。该代码记录了这些不同的边界行为,而不是施加单一的难度排序,使我们能够测试记忆是修复了失败模式还是仅仅改变了总体性能。在公式(4)中,\(\mathbf{q}_{i}=\mathbf{0}\) 表示非边界样本,而非零条目则标识相应的边界类型。计算 \(\mathbf{q}_{i}\) 可能需要标签或重复推理,因此我们仅在离线阶段使用它来表征样本和校准路由器。在推理阶段,第4.1节则使用生成前可用的任务特定输入代理。 **表1:** BioProBench 上的总体结果。除Brier分数(↓)外,所有指标越高越好。当可用时,重复运行变异报告为均值±标准差。粗体表示每个Qwen家族块中每列的最佳结果。Brier分数越低越好。 ### 3.2 内部知识边界的知识电路视角 基于查询的条件记忆通过从外部存储检索上下文相关的值来增强骨干隐藏状态。其效果取决于注入位置。对于样本 \(x_i\),令 \(\mathbf{r}_{i,\tau}\) 表示步骤 \(\tau\) 的推理状态,由层 \(l\) 和推理阶段 \(s \in \{\mathrm{pre}, \mathrm{dec}\}\) 的隐藏状态 \(\mathbf{h}_{i,\tau,l,s}\) 表示。我们将每个层-阶段对 \(v=(l,s)\) 定义为一个知识电路节点,其局部更新为: \[\begin{array}{rcl} \mathbf{z}_{i,\tau,l,s}&=&\mathrm{Query}_{l,s}\left(\mathbf{h}_{i,\tau,l,s}\right),\\ \mathbf{m}_{i,\tau,l,s}&=&\mathrm{Mem}\left(\mathbf{z}_{i,\tau,l,s}\right),\\ \Delta\mathbf{m}_{i,\tau,l,s}&=&\mathcal{P}_{l,s}\left(\mathbf{m}_{i,\tau,l,s}\right),\\ \widehat{\mathbf{h}}_{i,\tau,l,s}&=&\mathbf{h}_{i,\tau,l,s}+g_{i,\tau,l,s}\Delta\mathbf{m}_{i,\tau,l,s},\\ \mathbf{r}_{i,\tau+1}&=&\mathcal{F}_{l,s}\left(\widehat{\mathbf{h}}_{i,\tau,l,s}\right). \end{array}\] 这里 \(\mathrm{Query}_{l,s}\) 生成记忆查询,\(\mathbf{m}_{i,\tau,l,s}\) 是检索到的值,\(\mathcal{P}_{l,s}\) 将其投影为注入的残差 \(\Delta\mathbf{m}_{i,\tau,l,s}\),而 \(g_{i,\tau,l,s}\) 是本征记忆门。后续的骨干计算由 \(\mathcal{F}_{l,s}\) 表示。同一层的预填充和解码是不同的节点;因此,\((l,s)\) 是第4.2节中由内部路由器选择和缩放的干预单元。这种分解使得在固定剩余骨干计算的同时,对记忆贡献进行受控的因果衰减。它还区分了可用性和有用性:即使相关的检索值也可能并非在每个节点都有帮助,因为其效果取决于注入时的状态和阶段。因此,节点级表示将有用的检索关联与有害或无效的注入位置区分开来。 **表2:** ChemCoTBench 上的总体结果。除MAE(↓)外,所有指标越高越好。当可用时,重复运行变异报告为均值±标准差。粗体表示每个Qwen家族块中每列的最佳结果。MAE越低越好。 ## 4 条件记忆的知识边界感知路由 第3节提供了两种互补分析:行为边界码揭示了无记忆基础模型何时遇到困难,层-阶段知识电路节点则识别了记忆可在何处改变其计算。行为信号可能需要参考标签或重复推理,而...
相似文章
ReM-MoA:推理记忆维持混合智能体扩展
ReM-MoA 引入了一种记忆增强的混合智能体框架,通过排序推理记忆和策划的多样化记忆路由来维持扩展,在五个推理基准测试中优于之前的 MoA 变体。
MemReranker:面向智能体记忆检索的推理感知重排序
MemReranker 是一个针对智能体记忆检索设计的推理感知重排序模型家族(0.6B/4B),通过结合 LLM 知识蒸馏技术解决语义相似性匹配的局限性,从而提升模型的时间与因果推理能力。
循环中的记忆:进程内检索作为语言智能体的扩展工作记忆
本文介绍了“循环中的记忆”,其中语言智能体在每个推理步骤中反复访问进程内关联存储。通过使用快速(约100微秒)的进程内存储,每一步的检索成本相比网络存储降低了三个数量级,消除了冗余操作,并提升了GPT-5类模型的召回率。
Memora: 平衡抽象与具体性的和谐记忆表示
Memora 是一个可扩展的 AI 智能体记忆系统,它将存储与检索解耦,在长周期任务上实现了最先进的性能,同时使用的 token 数量减少了高达 98%。该研究发表于 ICML 2026。
@dair_ai: // 记忆即模型 // 该论文为任何LLM增加一个单独训练的记忆模型,用于存储、检索和整合…
MeMo 引入了一种模块化记忆模型,可为任何 LLM 增强存储、检索和整合新知识的能力,无需重新训练或担心灾难性遗忘。它在 BrowseComp-Plus、NarrativeQA 和 MuSiQue 等基准测试上优于基于 RAG 的方法。