AdaKP:面向推理的强化学习的在线自适应知识点选择

arXiv cs.AI 论文

摘要

介绍了AdaKP,一种在线自适应知识点选择器,能够在强化学习训练过程中动态重新选择注入哪些原子提示,以缓解推理任务中的奖励稀疏问题,在竞赛级数学基准上取得了改进,且开销可忽略不计。

arXiv:2607.24833v1 公告类型:新 摘要:基于可验证奖励的强化学习是一种在大型语言模型中引发推理能力的强大范式,但在竞赛级数学问题上存在严重的奖励稀疏问题。一种常见的补救方法是将原子知识点(KPs)——从金牌解答中提炼出的简短自然语言提示——注入提示词中。然而,现有方法要么一次性离线固定选择,要么只是单纯增加注入文本的数量,却未触及最具信息量的选择轴:注入哪些原子知识点子集,以及何时注入。我们提出了AdaKP,一种在线选择器,在强化学习训练过程中为每个问题重新选择知识点子集。其核心是一个熵代理(entropy proxy),通过知识点引起的下一个标记熵的减少来对其进行评分——仅需一次廉价的前向传播,且有可证明的截断偏差界限——取代了昂贵的基于rollout的估计。三种轻量级机制使该信号可在在线场景中使用:动量平滑器吸收每个步骤的噪声、退休与复兴管理器在保留探索的同时剪枝弱知识点、以及自适应调度器将重新评估前置到训练早期。AdaKP还贡献了一个预飞验证门(pre-flight validation gate),在启动任何昂贵运行之前,基于留一法真实值对代理进行认证,将方法级风险转化为可证伪的检查。作为标准DAPO+GRPO训练器的完全附加分支实现,无需修改优化器,AdaKP在所有八个竞赛数学基准上以可忽略的额外成本超越了强静态选择基线,将在线、经过验证的知识点子集选择定位为面向推理的强化学习中一个实用且尚未充分探索的维度。
查看原文
查看缓存全文

缓存时间: 2026/07/29 09:52

# 面向推理型强化学习的在线自适应知识点选择
来源:https://arxiv.org/html/2607.24833

###### 摘要

基于可验证奖励的强化学习是激发大型语言模型推理能力的一种有效范式,但在竞赛级数学问题上存在严重的奖励稀疏问题。一种常见的补救措施是将*原子知识点*(KPs)——从标准解答中提取的简短自然语言提示——注入到提示词中。然而,现有方法要么一次性离线固定选择,要么仅仅缩放注入文本的整体数量,而未触及最具信息量的选择维度:*注入哪些原子知识点的子集,以及何时注入*。我们提出 AdaKP,一个在线选择器,它在强化学习训练过程中为每个问题重新选择 KP 子集。其核心是一个*熵代理*,通过计算一个 KP 所导致的下一 token 熵的减少量来为其评分——仅需一次廉价的前向传播,并对其截断偏差有可证明的界——取代了昂贵的基于 rollout 的估计。三种轻量级机制使该信号可在线使用:一个抑制逐步噪声的动量平滑器,一个在保留探索能力的同时修剪弱 KP 的退休与复兴管理器,以及一个将重新评估前置到训练早期的自适应调度器。AdaKP 还贡献了一个*预飞行验证门*,在任何昂贵运行启动之前,通过留一法真实标签来认证该代理,从而将方法级风险转化为可证伪的检查。作为标准 DAPO+GRPO 训练器的纯加法分支实现(无优化器更改),AdaKP 在所有八个竞赛级数学基准测试上,以可忽略的额外成本,优于强静态选择基线,将在线、经过验证的 KP 子集选择定位为面向推理型强化学习中一个实用且尚未充分探索的维度。

## 1 引言

基于可验证奖励的强化学习 (RLVR) 能在相对较小的基础模型中引出涌现的思维链推理 (Wei 等, 2022; Wang 等, 2023; Yao 等, 2023),超越了保持策略不变的解码时增强方法 (Yao 等, 2023; Huang 等, 2024)。一个实际的瓶颈是*奖励稀疏性*:在困难的竞赛问题上,未经训练的 1.5B 模型仅在极少数 rollout 中能正确回答,导致 GRPO (Shao 等, 2024) 和 DAPO (Yu 等, 2025) 的优势函数退化。KnowRL (Yu 等, 2026) 通过从标准解答中提炼简短的*知识点* (KP) 并选择最小充分子集来解决此问题;通过约束子集搜索 (CSS) 离线选择该子集,将 1.5B 模型在八个基准测试上的平均准确率提升至 70.08%,同时将每个问题注入的提示从 5.86 个减少到 2.57 个。

#### 静态选择假设。

这种离线选择——CSS 及其同类方法——本质上是*静态的*:在冻结的基础模型上运行一次,将问题到子集的映射关系固化到训练数据中,并且不再重新审视。这假设 KP 的效用沿着策略轨迹是*平稳的*,即初始化时最佳提示在数千次 RL 步骤后仍然最佳。然而,RL 的存在就是为了改变策略:随着模型内化问题解决模式,每个 KP 的边际信息会发生变化,一些 KP 变得冗余,另一些则变成新的诊断性信息。

#### 并行的自适应提示工作是整体的。

最近的工作将在线自适应引入提示注入 (GHPO, Liu 等, 2025; HINT, Wang 等, 2025; ADHint, Zhang 等, 2025a; Stepwise Hints, Zhang 等, 2025b),但将每个提示视为一个单一的、整体的前缀,其*数量*或*粒度*随难度缩放;另一条并行的工作线 (HIVE, Wu 等, 2026; Reinforce-Ada, Xiong 等, 2025) 则过滤*整个提示*。两者都不在*原子 KP* 之间进行选择。据我们所知,AdaKP 是第一个在 RL 训练期间执行*原子知识点的在线子集选择*的工作。

#### 在线重新评估的成本。

在训练中期天真地重新运行 CSS 或留一法 (LOO) 边际准确性是不可行的:一次 CSS 传递需要约 \( \sim 8 \times 32 \) 次 rollout 和每个问题 \( \times 2^{|C|} \) 个子集评估,消耗了 `~13` 天运行的大部分时间,因此重复 5-10 次是不可行的。

#### 我们的贡献。

我们提出 AdaKP,一种在推理型 RL 期间替代离线 KP 选择的低成本的在线方法,围绕三个耦合的子问题构建——廉价的每步效用评分、偏差-方差控制以及在有界重新评估下对离散池的探索——并贡献了:

1.  **熵代理**。我们通过计算 KP \( k \) 对问题 \( q \) 所导致的下一 token 熵的减少量来为其评分:\( \mathrm{score}(q, k) = H(\pi(\cdot \mid q)) - H(\pi(\cdot \mid q \oplus k)) \),通过在生成的第一个 \( K=50 \) 个 token 上进行单次 vLLM (Kwon 等, 2023) 前向传播来估计,其中 \( q \oplus k \) 表示将 \( k \) 插入到提示模板的 `#\# Hint` 块中的提示 \( q \)。我们表明(命题 S1,技术补充材料),来自 top-\( L \) 对数概率采样的截断偏差由实现的尾部质量界定,并且经验上该代理对 KP 的排序与留一法真实标签一致 (\( \rho=0.68 \); §3.1)。这将每个问题的重新评估成本从 CSS 的 \( \mathcal{O}(\text{rollouts} \times 2^{|C|}) \) 或 LOO 的 \( \mathcal{O}((|C|+2)N) \) 降低到 \( |C|+1 \) 次短前向传播 (表 6)。
2.  **三种动态自适应机制**。我们将代理包裹在 (a) 一个抑制单步噪声的 EMA*动量平滑器*中,(b) 一个修剪持续低效用 KP 同时通过周期性随机复兴保留探索能力的*退休与复兴管理器*中,以及 (c) 一个将重新评估前置到早期训练的*自适应调度器*中。使用初始化时的权重冻结代理 (§6),这些机制提供了*去噪和探索*,而非策略追踪;对当前策略重新评分是自然的下一步。
3.  **一个训练前验证门**。一个针对分层抽样问题的留一法真实标签计算的 Spearman 秩相关系数门,必须在训练开始前通过 \( \rho > 0.6 \) 的阈值,从而认证该代理与黄金信号的一致性。这将方法级风险与训练成本解耦;据我们所知,在线 RL 选择启发式方法通常不伴随这种预飞行检查,尽管我们不声称此门是通用的先验证后训练想法中的第一个。
4.  **一个诊断优先的设计与开源发布**。我们将主要比较与组件消融实验(一对一映射到 §3 的设计原理)以及五轴超参数扫描相结合,并发布加法型 DAPO+GRPO 分支 (Yu 等, 2025; Sheng 等, 2025)、训练框架、代理代码和门控脚本。

## 2 相关工作

#### 面向 LLM 的推理型 RL。

通过 PPO (Schulman 等, 2017) 的 RLHF (Christiano 等, 2017; Stiennon 等, 2020; Ouyang 等, 2022) 统一对待每个提示;后来的工作简化了奖励模型的配方 (DPO, Rafailov 等, 2023; KTO, Ethayarajh 等, 2024; RLOO, Ahmadian 等, 2024; 以及自训练, Gulcehre 等, 2023; Singh 等, 2024)。对于数学推理,Havrilla 等 (2024) 系统化了 RL 的配方,GRPO (Shao 等, 2024) 用组相对基线取代了价值网络,而 DAPO (Yu 等, 2025) 为可验证奖励设置添加了 clip-higher、token 级损失和动态采样;纯 RLVR 在大规模上引出了长思维链 (DeepSeek-AI, 2025; OpenAI, 2024)。AdaKP 与这些优化器侧的进步是*正交的*:我们修改的是训练器看到的*提示分布*,而不是优化器,并在 DAPO+GRPO 之上原封不动地插入。

#### 提示和知识注入。

第一类方法要求模型生成自己的中间信号——Self-Refine (Madaan 等, 2023), STaR (Zelikman 等, 2022), Quiet-STaR (Zelikman 等, 2024), Reflexion (Shinn 等, 2023)——或通过过程奖励模型 (Lightman 等, 2024; Wang 等, 2024) 来密集化奖励,但此类自生成信号在没有外部锚点的情况下不可靠 (Huang 等, 2024),这激发了注入精选文本的动机。CSS (Yu 等, 2026) 是典型的外部 KP 实例;AdaKP 继承了其框架,但摒弃了其离线静态选择的假设。

#### 并行 RL 工作中的自适应引导。

一系列同时代的工作将*自适应性*引入到提示注入中。GHPO (Liu 等, 2025), HINT (Wang 等, 2025), ADHint (Zhang 等, 2025a) 以及 Capability-Adaptive Hint Scaffolding (Li 等, 2025) 都根据样本难度或近期奖励动态来缩放注入引导的*数量*或*比例*;Stepwise Hints (Zhang 等, 2025b) 改变步骤级前缀的粒度;针对多模态推理的 Hint-GRPO (Huang 等, 2025) 则对提示利用进行去偏。所有这些方法都决定*提示多少*或*以何种粒度*提示,但*仍然将提示视为一个单一的整体前缀*。相反,AdaKP 在一个离散的原子 KP 池上执行*在线子集选择*——这是没有先前方法解决的维度 (表 S1, 附录 C)。

#### 在线提示级过滤。

同时期的工作——HIVE (Wu 等, 2026) 和 Reinforce-Ada (Xiong 等, 2025)——使用提示级熵或奖励动态来选择*执行哪些提示的 rollout*。这与 AdaKP 是正交的:它丢弃了整个问题,而 AdaKP 在问题*内部*选择保留哪些 KP;两者可以组合。

#### 主动选择与课程学习。

我们的熵差代理遵循了信息论主动学习 (Kirsch 等, 2019)、优先经验重放 (Schaul 等, 2016) 和信息最大化探索 (Houthooft 等, 2016) 的传统,而我们的调度器呼应了课程学习 (Bengio 等, 2009)。新颖之处不在于信息增益标准——它已广泛建立——而在于其在离散的、外部策展的原子 KP 池上的应用,且预算不允许每步 rollout。

## 3 方法:AdaKP 选择器

#### 设置与符号。

对于每个问题 \( q \),从标准解答中提取候选 KP 集 \( C(q) = \{k_1, \dots, k_{|C(q)|}\} \),并通过约束子集搜索 (CSS) 生成一个离线子集 \( S^{\mathrm{css}}(q) \subseteq C(q) \),该搜索枚举子集并使用冻结的基础模型上的 \( N=32 \) 次 rollout 对每个子集进行评分 (Yu 等, 2026)。我们按照 DAPO (Yu 等, 2025) 的配方在 GRPO (Shao 等, 2024) 下进行训练——clip-higher \( \varepsilon_{\text{low}}=0.2 / \varepsilon_{\text{high}}=0.26 \),token 级损失,动态采样重rollout,无 KL 项——并使用可验证奖励 \( r(o, q)=\mathbf{1}\{\text{math-verify}(o, a(q))\} \)。全程,\( \pi_{\theta} \) 表示正在训练的策略,\( \pi^{\mathrm{proxy}} \) 是一个仅用于效用评分的参数冻结的 vLLM 实例;\( q \oplus k \) 表示将 KP \( k \) 注入到其 `Hint` 块中的提示 \( q \)。

#### 设计原理。

在线 KP 选择施加了三个约束,这些约束排除了直接移植 CSS 或现成采集函数的方法。(C1) 对约 \( \sim 8.8k \) 个问题的语料库中的每个 `(q, k)` 对进行评分必须在*几分钟内*完成,因此排除了任何多 rollout 信号。(C2) 单步代理分数存在噪声(小 \( K \) 熵估计),因此天真的 top-`k` 选择会波动。(C3) 池 \( C(q) \) 很小(5-7 个 KP),因此贪婪选择器会收敛到一个高分值子集,并排除那些仅在后期间才有用的 KP。AdaKP 的每个组件*恰好解决*其中一个失败模式:*熵代理* (§3.1) 解决了 C1;*动量平滑器* (§3.2) 吸收了 C2 的噪声;*退休与复兴管理器* (§3.3) 通过强制周期性重新探索来解决 C3;*自适应调度器* (§3.4) 将重新评估的成本前置到训练早期,此时重新选择有最多的步骤来产生回报。这种一对一映射使得每个组件的消融实验 (§5.3) 具有可解释性。

#### 运行状态。

对于每个问题 \( q \):\( P(q) \subseteq C(q) \) 是活动的*KP 池*,\( s_{q,k}^{(t)} \) 是平滑后的分数,\( \mathrm{sel}_{q} \) 是缓存的 top-\( \rho_{\text{sel}} \) 选择,训练器每一步都读取它。平滑器 \( S_q \) 和退休管理器 \( R_q \) 是每个问题独立的(因此问题以自己的速率进行修剪);调度器 \( \mathcal{S} \) 是一个全局对象。

### 3.1 熵代理

#### 直觉。

如果一个 KP \( k \) 解决了问题 \( q \) 推理链的一部分,那么将策略暴露给 \( k \) 应该会集中其下一 token 分布——降低熵。预期熵差 \( H(\pi(\cdot \mid q)) - \mathbb{E}_{k} H(\pi(\cdot \mid q \oplus k) \)

相似文章

KACE:面向数学推理的知识自适应上下文工程

arXiv cs.AI

KACE 引入了一种知识自适应上下文工程方法,通过认知树和分层自一致性将存储与使用分离,在 AIME 2025 上达到了 62.2% 的准确率——相比固定自一致性提升了 10.4 个百分点。