KACE:面向数学推理的知识自适应上下文工程

arXiv cs.AI 论文

摘要

KACE 引入了一种知识自适应上下文工程方法,通过认知树和分层自一致性将存储与使用分离,在 AIME 2025 上达到了 62.2% 的准确率——相比固定自一致性提升了 10.4 个百分点。

arXiv:2606.00532v1 公告类型:新 摘要:上下文工程可以在不更新权重的情况下改进大语言模型,但数学推理暴露了一个关键限制:在单个不断增长的提示中累积的反馈会导致上下文膨胀,并限制可使用的学习指导量。现有方法常常将存储(跨运行学习到的内容)与使用(针对特定问题包含的内容)混为一谈,因此继承了这种提示大小上限。我们引入了知识自适应上下文工程(KACE),它通过基于难度和领域的组织将存储与使用分离。在离线阶段,一个自我反思的学习循环将训练轨迹提炼成认知树:一个按问题难度和认知领域分层的类型化卡片知识库。每张卡片被分配到与其产生失败相对应的难度-领域节点。在评估时,分层自一致性通过每层一致性门控动态地将每个问题分类为容易、中等或困难。容易的问题无需检索卡片即可退出,而较难的问题仅检索树的匹配分支。这种分层方案在使用相当计算量的情况下达到或超过Best-of-N,并以78%的配对一致性对问题难度进行分类。主要的实证贡献是构建和使用一个由分层自一致性实现的按难度和领域分层的知识库。在AIME 2025上,KACE达到了62.2%的准确率,在相当的求解器调用预算下,比固定的Best-of-5自一致性绝对提升了10.4个百分点,并且比最强的学习型上下文基线Tiered + GEPA提升了5.6个百分点。我们还在MATH-HARD和OlymMATH的可验证子集上观察到一致的提升。
查看原文
查看缓存全文

缓存时间: 2026/06/02 15:47

# KACE:面向数学推理的知识自适应上下文工程 来源:https://arxiv.org/html/2606.00532 Jayant Parashar 计算学院 佐治亚大学 Jayant\.Parashar@uga\.edu & Suchendra M\. Bhandarkar 计算学院 佐治亚大学 suchi@uga\.edu ###### 摘要 上下文工程已成为一种有效方法,可在不更新权重的情况下改进大型语言模型在各类任务上的表现。然而,对于数学推理而言,将反馈单调地累积到单个不断增长的提示中会导致:1) 上下文膨胀:无关的指导开始挤占有用信息,以及 2) 有效知识存储上限受限于活跃提示的大小。现有的上下文工程方法常常混淆了存储(跨运行学习的内容)与使用(针对特定问题包含在提示中的内容),因此继承了这一瓶颈。我们提出了知识自适应上下文工程(KACE),它通过基于认知和难度的划分,将存储与使用分离开来。离线阶段,一个自我反思的学习循环将训练轨迹提炼成一棵认知树:一个由按问题难度和认知领域分层的类型化卡片构成的知识库。每张卡片被分配至对应其来源失败所在的难度-领域节点。在评估阶段,一个带有逐层一致性门控的分层自洽性过程,动态地将每个问题分类为简单、中等或困难:简单问题无需卡片即可退出,而升级的问题仅检索树中匹配的分支。仅凭此分层方案,其表现即可匹配或超越Best-of-NN,同时使用相当的计算资源,并以78%的成对一致性对问题难度进行分类。本文的核心实证贡献在于,借助分层自洽性,构建并使用了按难度和领域分层知识库。在AIME 2025上,KACE达到了62.2%的准确率:在相当的求解器调用预算下,相比于固定的Best-of-55自洽性,获得了10.4个百分点的绝对提升;相比于最强的学习上下文基线Tiered++GEPA,获得了5.6个百分点的提升。我们还在MATH-HARD和OlymMATH的可验证子集上观察到一致的收益。

## 1 引言

上下文工程通过学习围绕问题的信息,而非更新模型权重,来改进冻结的语言模型。然而,对于数学推理而言,学习上下文产生了一个实际瓶颈:如果每个反思经验都被累积到单个提示中,有用指导最终会与无关指导竞争,且可复用知识存储仍受限于活跃上下文的大小。现有方法,如ACE风格的演进剧本 (Zhang et al., 2025b (https://arxiv.org/html/2606.00532#bib.bib1)) 和GEPA风格的反思提示工件 (Agrawal et al., 2025 (https://arxiv.org/html/2606.00532#bib.bib15)),展示了从反馈中学习的价值,但它们通常将存储和使用紧密耦合:学习到的内容也是求解器所看到的内容。另一条研究路线表明,推理计算应自适应而非统一分配。自洽性通过采样多个求解路径并根据一致性进行选择来改进数学推理 (Wang et al., 2022 (https://arxiv.org/html/2606.00532#bib.bib6)),而自适应和级联风格的方法则根据问题难度调整推理努力 (Aggarwal et al., 2023 (https://arxiv.org/html/2606.00532#bib.bib50); Snell et al., 2024 (https://arxiv.org/html/2606.00532#bib.bib39); Kim et al., 2024 (https://arxiv.org/html/2606.00532#bib.bib46); Chang et al., 2026 (https://arxiv.org/html/2606.00532#bib.bib47))。我们在此基础上,采用了一个锁定的分层自洽性过程。在添加任何学习知识之前,这个分层过程已经匹配或超越了固定Best-of-55自洽性,同时使用相当的求解器调用预算:在AIME 2025、MATH-HARD和OlymMATH-EN上,分别获得了52.2%、73.3%和44.4%的准确率,而Best-of-55的准确率分别为51.8%、72.7%和40.7%(表3 (https://arxiv.org/html/2606.00532#S3.T3))。相同的退出路径也充当了一个经验性难度信号:其层级排序保留了AIME 2025问题对78%和MATH-HARD问题对80%的模型导出难度排序,远高于50%的随机基线(附录G (https://arxiv.org/html/2606.00532#A7))。我们引入了**知识自适应上下文工程**(KACE),一个利用这一层级信号将学习上下文存储与学习上下文使用分离的框架。离线阶段,KACE将训练轨迹提炼成一棵**认知树**:一个由按问题难度和认知领域分层的类型化卡片构成的知识库。每张卡片记录一个可复用的推理辅助工具,如引理、不变量、分解模式或验证规则,并被放置在其所学失败对应的难度-领域节点下。在评估阶段,分层自洽性通过逐层一致性门控将每个问题分类为简单、中等或困难:简单问题无需卡片即可退出,而升级的问题仅检索树中匹配的分支。因此,持久知识库可以增长,而无需强制每个问题读取整个存储库。

此设计源于我们在硬数学推理中观察到的一种失败模式。单调上下文累积可能因无关经验挤占有用信息而退化;仅按领域分区虽能暂时缓解,但未能解决难度不匹配问题;紧凑提示优化避免了部分膨胀,但限制了可存储的可复用知识量。KACE 解决了这些失败背后共同的假设:即一个活跃上下文应承担全部学习知识的负担。相反,它将学习上下文视为一个结构化资源,根据问题的经验性难度和领域进行条件读取。

#### 贡献。我们的贡献有三方面。
(1) **按难度和领域分层的认知树**。KACE 将可复用的数学推理知识存储在活跃提示之外,作为放置于难度-领域节点下的类型化卡片。
(2) **作为难度分类器的锁定分层自洽性**。我们引入分层自洽性,既作为固定自洽性的计算等价替代方案(在三个基准上匹配或超越 Best-of-55),也作为校准的经验性难度信号:其退出排序保留了 AIME 2025 问题对 78% 和 MATH-HARD 问题对 80% 的模型自身求解率排序,为 \(\theta_R\) 提供了难度坐标,无需训练单独的分类器。
(3) **硬数学推理上的实证证据**。在 AIME 2025 上,KACE 实现了 62.2% 的准确率,在相当的求解器调用预算下,比固定 Best-of-55 自洽性获得了 10.4 个百分点的绝对提升,比最强的学习上下文基线 Tiered++GEPA 获得了 5.6 个百分点的提升。我们还在 MATH-HARD 和 OlymMATH 的可验证子集上观察到一致的收益,消融实验将难度和领域轴的价值分离出来。

## 2 方法论

### 2.1 问题设定:认知-难度上下文函数

KACE 用一个结构化的外部上下文包裹一个冻结的求解器。学习对象是一棵**认知树** \(\mathcal{K}\):一个由按问题难度和认知领域索引的类型化卡片构成的持久存储库。令 \(\mathcal{T} = \{\mathrm{ES}, \mathrm{MS}, \mathrm{HS}\}\) 表示三个难度层级,\(\mathcal{D}\) 表示领域集合。该树是一个块结构对象:
\[
\mathcal{K} = \{\mathcal{K}_b\}_{b \in \mathcal{B}}, \quad \mathcal{B} = \mathcal{T} \times \mathcal{D},
\]
其中每个块 \(b = (t, d)\) 包含在难度层级 \(t\) 和领域 \(d\) 下可见的卡片;通用卡片存储在 \(\mathcal{K}_{\mathrm{univ}}\) 中,在学习卡片层级下可见。对于问题 \(x\),活跃上下文为:
\[
C(x; \theta_R, \mathcal{K}) = \mathrm{Concat}\big(x, \rho(x; \theta_R, \mathcal{K})\big),
\]
其中
\[
\rho(x; \theta_R, \mathcal{K}) = \begin{cases} \emptyset, & \theta_R(x) \in \{\mathrm{ES}\} \times \mathcal{D}, \\ \mathcal{K}_{\theta_R(x)} \cup \mathcal{K}_{\mathrm{univ}}, & \theta_R(x) \in \{\mathrm{MS}, \mathrm{HS}\} \times \mathcal{D}. \end{cases}
\]
投影 \(\theta_R\) 使用两个信号将 \(x\) 映射到树的一个块:由分层自洽性发出的经验性难度层级和一个粗略的认知领域标签。该公式将**存储**与**注入**分离开来:\(\mathcal{K}\) 可以包含许多卡片,但每次求解只读取由 \(\theta_R\) 选择的块加上通用卡片,而 ES 不读取任何学习卡片。图1 (https://arxiv.org/html/2606.00532#S2.F1) 展示了从问题到层级/领域投影,再到一个小型活跃上下文的路径。

<figure>
<img alt="Figure 1: KACE architecture." src="..." />
<figcaption>图 1:KACE 架构。一个冻结的基础 LLM 作为求解器。在测试时,分层自洽性提供经验性难度层级,领域分类器提供认知领域标签;它们共同将认知树 \(\mathcal{K}\) 投影到单个 (难度, 领域) 块。ES 不读取学习卡片,而 MS 和 HS 只读取所选块下的卡片。流程是锁定的:ES(2 次尝试,2/2 一致门控)→ MS(3 次尝试,2/3 多数门控)→ HS(5 次尝试,2/5 复数门控),并有一个 10 次池化的复数回退。</figcaption>
</figure>

#### 与先前上下文方法的关系。
ACE、GEPA 和扁平检索均可视为该上下文函数的限制。ACE 将两个轴折叠到一个增长的提示中;GEPA 进一步将学习对象压缩为单个自然语言工件;扁平检索保留扁平的 \(\mathcal{K}\) 并用 top-\(k\) 相似性搜索替代硬投影。KACE 保留了难度和领域轴,并使测试时投影显式化。

### 2.2 分层自洽性与树读取

投影 \(\theta_R\) 由一个锁定的分层自洽性流水线提供。一个粗略分类器首先分配一个领域标签 \(d\)。然后求解器运行三个递增层级:ES 使用两次尝试,在 2/2 一致时退出;MS 使用三次尝试,在 2/3 多数时退出;HS 使用五次尝试,在 2/5 复数时退出。如果没有层级退出,系统池化所有 10 次尝试,并在可能时返回池化复数。门控触发的层级即为 \(\theta_R\) 使用的经验性难度信号。在每个学习卡片层级,求解器只读取树中匹配的节点。ES 是无卡片门控:它只读取问题,仅在 2/2 一致时退出。MS 读取 \(\mathcal{K}_{(\mathrm{MS}, d)}\),HS 读取 \(\mathcal{K}_{(\mathrm{HS}, d)}\),各自与通用卡片一起。推理形状在所有实验中固定;只有学习的树 \(\mathcal{K}\) 变化。

表 1:锁定分层自洽性。形状、逐层退出门控和回退链在所有实验中不变。每个学习卡片层级读取的卡片节点由严格的逐层难度可见性(ES → 无卡片,MS → {中等, 通用},HS → {困难, 通用})与活跃领域标签的交集决定。

### 2.3 认知树的离线构建

离线学习器从训练分割 \(T = \{(x_i, y_i)\}\) 构建 \(\mathcal{K}\)。概念上,它旨在最小化经验答案损失:
\[
\mathcal{L}(\mathcal{K}) = \frac{1}{|T|} \sum_{(x_i, y_i) \in T} \ell\!\left(y_i, \pi_S(C(x_i; \theta_R, \mathcal{K}))\right),
\]
其中 \(\pi_S\) 是冻结求解器,\(\ell\) 是答案级错误。由于 \(\pi_S\)、自洽性投票和卡片选择是黑盒且非光滑的,我们不计算梯度。相反,每个失败轨迹提供一个自然语言残差:对实际读取块下缺失知识的局部描述。

#### 阶段 1 — ADD:作为块局部上下文学习的失败轨迹学习。
在第 \(n\) 轮,我们用当前树 \(\mathcal{K}^{(n)}\) 运行分层求解器。这会诱导一个块分配 \(b_i^{(n)} = \theta_R(x_i; \mathcal{K}^{(n)})\),并且对于每个块 \(b\),一个残差集:
\[
R_b^{(n)} = \{\tau_i^{(n)} : b_i^{(n)} = b, \; \pi_S(C(x_i; \theta_R, \mathcal{K}^{(n)})) \neq y_i\}.
\]
ADD 阶段使用仅自身残差更新每个块:
\[
\widetilde{\mathcal{K}}_b^{(n+1)} = \mathcal{K}_b^{(n)} \cup A_b(R_b^{(n)}, \mathcal{K}_b^{(n)}),
\]
其中 \(A_b\) 是一个教师反思算子,为在 \(R_b^{(n)}\) 中观察到的缺失引理、不变量、归约或验证检查提出紧凑卡片。这是文本梯度和反思提示更新方法 (Pryzant et al., 2023 (https://arxiv.org/html/2606.00532#bib.bib18); Agrawal et al., 2025 (https://arxiv.org/html/2606.00532#bib.bib15); Zhang et al., 2025b (https://arxiv.org/html/2606.00532#bib.bib1)) 的块局部模拟。KACE 能够在一个阶段添加许多卡片的原因在于,它不是对单个提示进行一个大编辑;而是对 \(\mathcal{K}\) 的条件激活块进行局部编辑。这遵循了块坐标和块序贯最小化的结构直觉:在全局分解保持固定的同时,使用局部代理信息优化大型对象的各个部分 (Razaviyayn et al., 2013 (https://arxiv.org/html/2606.00532#bib.bib52))。

#### 阶段 2 — REFINE:在诱导的后更新分布下。
临时树 \(\widetilde{\mathcal{K}}^{(n+1)}\) 改变了求解器看到的上下文,从而改变了哪些层级触发、哪些卡片被读取以及哪些残差失败仍然存在。在 \(\mathcal{K}^{(n)}\) 下看似有用的卡片,在新的树下可能变得冗余、错位或有害。因此,我们使用 \(\widetilde{\mathcal{K}}^{(n+1)}\) 运行第二次遍历,并收集轨迹 \(\widetilde{\tau}_i^{(n+1)} \sim \pi_S(C(x_i; \theta_R, \widetilde{\mathcal{K}}^{(n+1)}))\)。这些轨迹定义了后更新残差集 \(\{\widetilde{R}_b^{(n+1)}\}_{b \in \mathcal{B}}\)。然后策展人应用:
\[
\mathcal{K}^{(n+1)} = Q\left(\widetilde{\mathcal{K}}^{(n+1)}, \{\widetilde{R}_b^{(n+1)}\}_{b \in \mathcal{B}}\right),
\]
其中 \(Q\) 可以保留、编辑、重新定位或弃用现有卡片,但不引入新卡片。第二次遍历解决了由 DAgger 风格数据集聚合 (Ross et al., 2011 (https://arxiv.org/html/2606.00532#bib.bib53)) 形式化的相同诱导分布问题:修正应在当前策略诱导的行为分布下评估,而不仅仅在更新前收集的轨迹下。在 KACE 中,相关策略是冻结求解器包裹在当前上下文函数下的结果。因此,REFINE 在实际使用卡片的上下文中评估卡片。在少量固定轮数之后,整个树在验证或测试评估之前被冻结。

相似文章

AdaKP:面向推理的强化学习的在线自适应知识点选择

arXiv cs.AI

介绍了AdaKP,一种在线自适应知识点选择器,能够在强化学习训练过程中动态重新选择注入哪些原子提示,以缓解推理任务中的奖励稀疏问题,在竞赛级数学基准上取得了改进,且开销可忽略不计。

RAG 能知道检索错误吗?在知识冲突下诊断上下文遵从性

arXiv cs.CL

本文提出了一种名为“上下文驱动分解”(CDD)的探针,用于诊断检索增强生成(RAG)系统在面对检索上下文与参数化知识冲突时,是否遵从检索上下文。同时,发布了 Epi-Scale 基准测试,以便在多种模型家族中进行系统性研究。

SCAIR:模式条件代理迭代推理用于企业知识图谱

arXiv cs.AI

SCAIR引入了一种无需训练的框架,用于企业知识图谱的推理。该框架通过注入基于模式的结构先验,并在多跳推理过程中强制进行模式感知的遍历,在真实的CMDB基准测试上展现了性能提升。