ISM:用于连续数学推理的自我改进策略记忆

arXiv cs.LG 论文

摘要

ISM引入了一个自进化记忆系统,该系统存储并优化策略模式,以在连续学习场景下提升冻结LLM的数学推理能力,在MATH-Hard和OlympiadBench基准上优于基线方法。

arXiv:2606.31191v1 公告类型:新 摘要:我们提出智能模式记忆(ISM),一个自进化的记忆增强系统,在带有硬性情节重置的连续学习下提升冻结LLM的数学推理能力。ISM维护一个紧凑且自我精炼的策略模式库,这些模式从成功和失败的情节中学习,并配备符号工具检查中间步骤并验证答案。在不更新模型参数的情况下,ISM在MATH-Hard和OlympiadBench上优于被动、检索和反思基线,使用的模式分别比最强的被动基线少64%和86%。这些结果表明,在严格的情节隔离下,小型、主动维护且经过验证的策略记忆能够支持可靠的连续数学推理。
查看原文
查看缓存全文

缓存时间: 2026/07/01 05:34

# ISM:持续数学推理中的自我改进策略记忆
来源: https://arxiv.org/html/2606.31191

###### 摘要

我们提出了**智能模式记忆 (ISM)**,一个自我进化的记忆增强系统,它能在具有严格情节重置的持续学习环境下,提升冻结大语言模型 (LLM) 的数学推理能力。ISM 维护一个紧凑的、自我精炼的策略模式库,该库从成功和失败的经历中学习,并利用符号工具检查中间步骤并验证答案。在不更新模型参数的情况下,ISM 在 MATH-Hard 和 OlympiadBench 上优于被动、检索和反思基线,其使用的模式数分别比最强的被动基线少 64% 和 86%。这些结果表明,在严格的情节隔离条件下,小型、主动维护且经过验证的策略记忆能够支持可靠的持续数学推理。代码库见 https://github.com/pdx97/ISM。

大语言模型, 持续学习, 数学推理, 外部记忆

参照图注
Figure 1: ISM 系统的流水线。一个问题依次经过特征提取器(基于规则和基于LLM,并带有一致性评分),然后进入带有两阶段检索(算子过滤和软评分)的模式库。检索到的模式内容被注入冻结的 LLM 求解器,求解器可以调用可验证工具。在每个情节之后,记忆控制器的自我改进循环(虚线箭头)更新模式库。

## 1 引言

大语言模型 (LLMs) (Zhao 等, 2026 (https://arxiv.org/html/2606.31191#bib.bib11)) 在解决孤立的数学问题上表现出色,但在面对跨越不断变化的领域、顺序出现的问题流时,却常常陷入困境。由于每个新问题都从相同的冻结参数开始,模型从前一个任务中获得的任何见解在下一个任务开始之前就丢失了。这突出了冻结骨干下持续学习的核心挑战:任何累积改进都必须完全存在于模型之外,即一个外部知识库中。数学推理因其清晰的结构规则和可验证的正确性,为研究这种动态提供了理想的试验平台。此外,设计一个能在不重新训练的情况下随时间改进的系统,触及了 AI 领域的一个基本问题:*一个冻结的 LLM 如何在数学推理上自我进化,同时保持其积累的知识是有界的、可验证的和可靠的?*

现有方法解决了这一挑战的某些方面,但留下了关键空白。基于反思的方法,如 Reflexion (Shinn 等, 2023 (https://arxiv.org/html/2606.31191#bib.bib2)),在失败后生成口头反馈,但这种反馈仍然是自由文本,而非可重复使用的结构化策略。检索增强设置简单地存储原始历史示例;它们无限制地增长,并完全依赖表面层面的嵌入相似性来决定检索内容。同时,类似 Voyager (Wang 等, 2023 (https://arxiv.org/html/2606.31191#bib.bib22)) 的技能库系统构建了可执行的学习行为库,但这些库只增不减。它们缺少验证新条目、合并近似重复条目或淘汰过时策略的机制。因此,当前系统无法以受控的方式进行自我改进;它们要么忘记过去的教训,要么存储膨胀,要么积累噪声。

为了解决这些局限性,我们提出了**智能模式记忆 (ISM)**,一个自我进化的记忆框架,它能够检索策略并通过自主的自我改进循环主动管理其知识库,同时保持底层 LLM 冻结。ISM 维护一个紧凑的策略模式库。每个模式分为两个部分:一个**内容部分**,包含策略描述、解决方案模板和注入求解器提示的启发式方法;以及一个**特征钩子**,包含基于结构和嵌入的检索信号,这些信号会根据使用情况在线调整。这种分离将模式知道什么与如何发现它解耦,使得检索精度能够随着经验积累而提高,而无需改变底层策略。

记忆库由七种自我改进机制维护:四种机制管理质量和规模(审计、合并、修剪和提升/降级),两种机制对称地从结果中学习(**强化**加强成功路径,而**反模式**记录要避免的失败),还有一种机制在面临修剪之前恢复表现不佳的模式。至关重要的是,每一次记忆更新都通过符号验证把关,防止记忆库强化有缺陷的泛化。这些机制共同将外部记忆从一个被动的存储单元转变为一个主动维护、有界且自我纠正的资产。对称的成功/失败学习、在线适应检索、生命周期管理和验证把关的结合,正是 ISM 区别于先前基于冻结 LLM 构建的记忆增强系统的关键所在。

我们在一个持续学习的 300 情节流 (Wang 等, 2024 (https://arxiv.org/html/2606.31191#bib.bib9)) 上,在两个竞赛级基准测试 MATH-Hard (Hendrycks 等, 2021 (https://arxiv.org/html/2606.31191#bib.bib31)) 和 OlympiadBench (He 等, 2024 (https://arxiv.org/html/2606.31191#bib.bib7)) 上评估 ISM,并与五种基线进行比较:原始、检索、反思、静态模式和被动模式记忆。ISM 在两个基准测试中都取得了最高的准确率,同时其存储的模式数比最强的被动基线少 64% 和 86%,比基于检索的系统少高达 23 倍。随着问题流的推进,这种性能差距会扩大:ISM 在应对领域转换方面比任何基线都更具韧性,并且其记忆库保持严格有界,而基于检索的存储则随遇到的问题数量线性增长。我们的主要贡献是:

- • 我们引入了 **ISM**,一种自我进化的记忆架构,具有自主的自我改进循环,能够检索策略,对称地从成功和失败中学习,并通过符号验证把关每一次更新。
- • 我们提出了一种双重表示模式设计,将内容(做什么)与检索特征(何时应用)解耦,使得检索能够在线适应,而策略内容保持稳定。
- • 我们在具有严格情节重置的持续学习协议下,在 MATH-Hard 和 OlympiadBench 上评估 ISM,它优于五种基线,同时使用的存储空间减少了 23 倍。

## 2 相关工作

##### 模型内记忆与持续学习。

最近的一系列工作通过重新设计模型的内部记忆基质来解决持续学习问题。Titans (Behrouz 等, 2024 (https://arxiv.org/html/2606.31191#bib.bib20)) 引入了一个神经长期记忆模块,该模块能够在测试时进行学习,将表示划分为一个短期注意力缓冲区和一个长期循环记忆(其参数在推理期间更新)。嵌套学习 (Behrouz 等, 2025 (https://arxiv.org/html/2606.31191#bib.bib21)) 将这一观点泛化,将模型重新诠释为具有不同更新频率的嵌套优化问题的层次结构,包括用于瞬态上下文的快速内循环和用于稳定知识的慢速外循环,并在 HOPE 架构及其连续记忆系统中实例化。这些方法通过在架构层面丰富模型自身的记忆基质来减轻灾难性遗忘。ISM 是互补的:我们不重新设计基质,而是将 LLM 完全冻结,并将记忆层次外部化为一个带有显式生命周期管理的符号模式库。这两个方向在很大程度上是正交的,原则上可以结合。

##### 外部记忆与技能库。

一些系统将外部记忆附加到冻结的模型上。MemGPT (Packer 等, 2023 (https://arxiv.org/html/2606.31191#bib.bib23)) 引入了由可搜索档案支持的分层上下文窗口,而智能体记忆系统通过动态结构组织过去的事件。技能库系统,如 Voyager (Wang 等, 2023 (https://arxiv.org/html/2606.31191#bib.bib22)),在智能体在环境中操作时累积可执行技能,成功时添加新技能。检索增强生成 (Lewis 等, 2020 (https://arxiv.org/html/2606.31191#bib.bib24)) 通过嵌入相似性检索原始历史示例。ISM 在三个轴向上有所不同:记忆库存储的是紧凑的符号模式,而非可执行代码或原始示例;检索特征和记忆库内容通过显式的自我维护机制演化,而非单调增长;每次更新在提交之前都经过符号验证把关。

##### 自我反思与自我改进。

基于反思的方法在失败后生成口头批评。Reflexion (Shinn 等, 2023 (https://arxiv.org/html/2606.31191#bib.bib2)) 存储每个情节的自然语言反思,Self-Refine (Madaan 等, 2023 (https://arxiv.org/html/2606.31191#bib.bib12)) 在单个问题内迭代批评-修订。STaR (Zelikman 等, 2022 (https://arxiv.org/html/2606.31191#bib.bib26)) 通过在自生成的理由上进行微调来引导推理。大多数先前的系统在其学习信号上是不对称的,要么积累正例(STaR, Voyager),要么积累负面反馈(Reflexion),但不能同时将两者作为结构化的、可检索的知识。ISM 通过对称的机制将两者视为互补信号:**自我强化**从成功的情节中提炼积极的启发式方法,而**自我反模式**从失败中记录要避免的错误,两者都被注入求解器提示。

##### 数学推理与验证。

思维链提示 (Wei 等, 2022 (https://arxiv.org/html/2606.31191#bib.bib27)) 及其程序辅助变体 (Chen 等, 2022 (https://arxiv.org/html/2606.31191#bib.bib28); Gao 等, 2023 (https://arxiv.org/html/2606.31191#bib.bib29)) 能够从冻结的 LLM 中引出逐步推理。过程奖励模型 (Lightman 等, 2023 (https://arxiv.org/html/2606.31191#bib.bib30)) 在步骤级别对推理进行评分,用于验证器引导的生成。MATH 基准测试 (Hendrycks 等, 2021 (https://arxiv.org/html/2606.31191#bib.bib31)) 和诸如 OlympiadBench (He 等, 2024 (https://arxiv.org/html/2606.31191#bib.bib7)) 等竞赛级评估推动了该领域的进步。ISM 将模式引导的提示与中间步骤和最终答案的正式符号验证结合起来,不仅使用验证来检查输出,还将其用作进入记忆的质量门槛。

## 3 方法

ISM 由五个在每个情节中交互的组件组成:(i) **特征提取器**,将问题转换为结构化表示;(ii) **模式库**,其中每个模式分为内容和特征钩子;(iii) **两阶段检索**程序,选择与当前问题最相关的模式;(iv) **冻结的 LLM 求解器**,使用检索到的模式进行提示,并可选择调用可验证工具;以及 (v) **记忆控制器**,在每个情节后在库上运行一个自我改进循环。图 1 (https://arxiv.org/html/2606.31191#S0.F1) 展示了这些组件如何交互。本节的剩余部分将形式化该设置,描述每个组件,并详细说明将 ISM 与被动记忆基线区分开来的验证把关更新。

### 3.1 问题设定

我们研究流式情节协议下的持续数学推理。一个问题流 \( \mathcal{S}=\{(x_{1},y_{1}),\dots,(x_{T},y_{T})\} \) 被划分为 \( B \) 个块,每个块包含 \( N \) 个问题,每个块来自一个单一的数学领域(例如,代数、几何、数论)。在情节 \( t \),系统观察问题 \( x_{t} \) 并生成候选答案 \( \hat{y}_{t} \)。在每个块之后,领域会发生变化。

关键的是,每个情节在**严格情节重置**下处理:模型从之前的情节中得不到任何上下文,除了显式存储在外部记忆 \( \mathcal{M}_{t} \) 中的内容。形式化地,求解器计算

\[
\hat{y}_{t} = f_{\theta}(x_{t}, \mathcal{M}_{t}), \tag{1}
\]

其中 \( f_{\theta} \) 是一个具有固定参数 \( \theta \) 的冻结 LLM,而 \( \mathcal{M}_{t} \) 是在情节 \( t \) 开始时的模式库。在观察到结果后,记忆控制器将库更新为 \( \mathcal{M}_{t+1} \)。冻结参数的约束将外部记忆的贡献与任何模型内适应隔离开来。

我们使用四个标准指标评估持续学习行为:平均准确率、可塑性(当前块领域的准确率)、稳定性(先前见过领域的准确率)、遗忘(过去领域准确率相对于上次访问时的下降)以及反向迁移(BWT,随着新领域的加入,过去领域准确率的变化)。

### 3.2 特征提取器

每个问题 \( x_{t} \) 被映射到一个结构化的 `ProblemFeatures` 对象,该对象捕获四个属性:一个**算子类型**(代数、数论、几何、组合、概率或微积分),一个**结构模式**(例如,`two_agents_combined`, `optimization`, `evaluate_expression`),一组**启发式签名**(例如,`decompose`, `work_backwards`, `apply_theorems`),以及问题文本的**语义嵌入**。

ISM 使用一个混合提取器,结合了一个基于规则的分支(关键词匹配器和表面形式模式)和一个基于 LLM 的分支(轻量级分类调用)。两个输出通过一个一致性分数进行协调,该分数计算为四个属性级比较的加权和:

\[
\mathrm{conf} = 40 \mathbf{1}[o_{r}=o_{l}] + 30 \mathbf{1}[p_{r} \in P_{l}^{\text{top-2}}] + 15 \, J(H_{r}, H_{l}) + 15 \, \mathrm{sim}_{q}(q_{r}, q_{l}), \tag{2}
\]

其中下标 \( r \) 和 \( l \) 分别表示基于规则和基于 LLM 的提取,\( o \) 是算子类型,\( p \) 是结构模式,\( H \) 是启发式集合,而 \( q \) 是量签名。\( J \) 表示启发式集合上的 Jaccard 相似度,\( \mathrm{sim}_{q} \) 在属性级别重叠上评分量签名(已知量和未知量的计数,速率、时间和约束的存在)。结构匹配是宽松的:如果 \( p_{r} \) 出现在 LLM 的 top-2 预测结构 \( P_{l}^{\text{top-2}} \) 中,则认为匹配。四个权重加起来等于一,因此阈值 \( \mathrm{conf} \geq 0.60 \) 要求 LLM 提取在与规则提取器的加权属性质量匹配中至少达到 60%。当满足此阈值时,使用 LLM 特征;否则,基于规则的特征作为后备。输出是一个 `ProblemFeatures` 元组 \( (o_{t}, p_{t}, H_{t}, q_{t}, e_{t}) \),其中嵌入 \( e_{t} \) 由句子编码器独立计算,然后传递给模式库。

### 3.3 两阶段检索

给定问题特征 \( F_{t} \),检索分两个阶段选择一个模式。

##### 阶段 1:算子过滤。

一个硬性过滤器将候选模式限制为其钩子 `operator_type` 与 \( F_{t}.\text{operator} \) 匹配的模式。这在进行评分之前,就消除了整个不相关模式家族(例如,为数论问题准备的几何模式)。

##### 阶段 2:软评分。

每个幸存候选模式 \( s \) 接收一个加权分数,结合结构、启发式、量、嵌入和先验项:

\[
\text{score}(s, F_{t}) = \sum_{k \in K} w_{k} \cdot \text{sim}_{k}(s, F_{t})
\]

相似文章

SelfMem: 面向AI智能体的自优化记忆框架

arXiv cs.CL

SelfMem提出了一种面向AI智能体的自优化记忆框架,使其能够通过记忆工具和反馈信号探索、评估和优化自身的记忆策略,在BEAM基准测试上,于大型对话规模下相较于基线方法取得了显著改进。

SAM:面向长程推理智能体的状态自适应记忆

Hugging Face Daily Papers

本文提出 SAM,一个状态自适应记忆框架,能够动态管理长程智能体推理中的交互历史,实现意图驱动的回忆,而无需重新训练基础模型。它在多个基准测试(如 BrowseComp 和 HLE)上优于强基线方法。