从记忆到吸收:用于持续知识注入的混合策略强化学习

arXiv cs.CL 论文

摘要

本文提出Golden-GRPO Injection (GRIN),一种用于大语言模型持续知识注入的混合策略强化学习框架,克服了监督微调的局限性。实验表明,在知识吸收基准上表现卓越。

arXiv:2608.25243v1 Announce Type: new 摘要:持续知识注入对于在快速发展的世界中保持大语言模型的最新状态至关重要。现有方法依赖监督微调(SFT),它以训练格式记忆注入的事实,但在改写、文档组合和推理方面未能泛化。为解决此问题,我们提出Golden-GRPO Injection (GRIN),一个用于持续知识注入的三阶段自学习框架。Golden-GRPO是一种专为知识注入设计的混合策略强化学习算法,即使在策略内滚屏在新事实上失败时,也能注入黄金答案以提供学习信号。我们进一步引入Blank和Counter,两个文档级基准,分别针对新知识获取和反事实覆写,每个基准评估单事实召回、多源检索和推理能力。我们的实验确立了一个明确的实证主张:混合策略强化学习能够实现监督微调无法达到的知识吸收。GRIN在较难的问题类型上显著优于SFT和混合策略RL基线,同时在基本事实召回上与之匹配。
查看原文
查看缓存全文

缓存时间: 2026/08/27 09:17

# 混合策略强化学习实现持续知识注入
来源:https://arxiv.org/html/2608.25243

## 从记忆到内化:混合策略强化学习实现持续知识注入

Fan Zhao(单位:加州大学默塞德分校 | 邮箱:[[email protected]](mailto:[email protected]))
Zhiyu An(单位:加州大学默塞德分校 | 邮箱:[[email protected]](mailto:[email protected]))
Wan Du(单位:加州大学默塞德分校 | 邮箱:[[email protected]](mailto:[email protected]))

###### 摘要
持续知识注入对于在快速变化的世界中保持大型语言模型与时俱进至关重要。现有方法依赖于监督微调(SFT),它们通过训练格式记忆注入的事实,却无法泛化到改写、文档组合及推理场景。为此,我们提出了黄金-GRPO注入(Golden-GRPO Injection, GRIN),这是一个用于持续知识注入的三阶段自学习框架。黄金-GRPO是一种专为知识注入设计的混合策略强化学习算法,它通过注入黄金答案来提供学习信号,即使在线策略滚动在新事实上失败时也能有效工作。我们进一步引入Blank与Counter两个文档级基准测试,分别针对新知识的获取和反事实覆盖进行评估,每个基准测试评估单事实召回、多源检索和推理能力。我们的实验提出了一个明确的经验性论断:混合策略强化学习能够实现超越监督微调的知识内化。GRIN在更困难的问答类型上显著优于SFT和混合策略强化学习基线方法,同时在基本事实召回方面与之持平。

## 1 引言
大型语言模型(LLMs)(Yang et al. 2025; Liu et al. 2024; Touvron et al. 2023)在搜索助手和基于知识的问答任务等知识密集型应用中表现出色(Yue 2025; Xu et al. 2024),这得益于其在预训练阶段获得的丰富事实知识(Dong et al. 2019)。然而,作为一个静态的固定参数模型,LLMs在快速变化的世界中很容易过时(Zhang et al. 2025a; Lin et al. 2025)。传统的应对方式是丢弃旧模型,并从头开始训练新模型,同时整合更新的数据和架构改进(Yang et al. 2025)。这个循环虽然有效,但成本高昂、耗时,并将知识更新视为定期重训练的副产品,而非首要目标。

终身学习或持续知识注入(Wu et al. 2024b)旨在通过使用最新的真实世界语料库对LLMs进行后训练来解决这个问题。现有的持续知识注入方法(Ovadia et al. 2024; He et al. 2025)可以大致根据其训练数据格式进行分类。第一组直接在原始领域语料库上训练,允许大规模的知识覆盖,但在推理时往往难以回忆,因为模型在面对问题式查询时难以提取注入的知识(Jang et al. 2021; Cheng et al. 2023)。第二组从领域知识构建多样化的问答对,以弥合训练和评估格式之间的差距,从而提高召回率(Zhang et al. 2025a; Jiang et al. 2025)。这两组方法都依赖监督微调(SFT)损失来记忆知识,并且存在两个共同的局限性。首先,注入的知识通常无法泛化到超出训练分布的未见查询,限制了实际应用(Krishnamurthy et al. 2024)。其次,它们未能明确考虑模型现有的参数化信念,使得过时或错误的先验知识未被处理,并允许其在推理时干扰新注入的事实。

最近的工作(Chu et al. 2025)表明,SFT往往鼓励记忆而非可泛化的内化,而强化学习则不同。尽管这一发现是在推理任务中得出的,但我们假设同样的模式也体现在知识注入中,并且强化学习提供了一条超越表面记忆的途径。然而,现有的混合策略RL方法(Yan et al. 2026; Zhang et al. 2025b)是为推理设计的,其中模型已经具备底层能力,RL只需提供方向性引导。知识注入需要更强的牵引力,但其离策略梯度在未学习的事实(附录E)上会消失。因此,我们提出了GRIN,一个用于持续知识注入的三阶段框架,它遵循SFT后接RL的流程,并在中间加入一个多样化问题集构建阶段。基础模型在第一阶段的SFT中提取问答对,在第二阶段采样多样化的问题和黄金答案,然后在第三阶段通过强化学习在此问题池上进行训练。

将RL应用于新知识的一个关键挑战是,基础模型的滚动策略在未学习的事实上的表现往往完全失败,没有留下正向奖励信号。我们通过黄金-GRPO来解决这个问题,这是一种混合策略RL算法,当在线策略滚动失败时,它将黄金答案作为离策略轨迹注入,从而保证在每个训练步骤都能提供有意义的学习信号。为了严格评估持续知识注入,我们引入了两个互补的基准测试:Blank与Counter。Blank针对新知识的获取,Counter针对先验信念的覆盖。两个基准测试都评估三种问题类型:单事实召回、多源检索和推理能力。这些问题类型旨在区分表面记忆和真正的知识内化。Counter额外报告了fail@k指标,衡量模型的先验信念在k次采样中是否重新出现,以捕捉覆盖的可靠性。

总之,我们的贡献有三点:
1.  我们提出了GRIN,一个用于持续知识注入的三阶段框架,无需外部教师模型,它建立在黄金-GRPO之上,这是一种专为知识注入场景设计的混合策略强化学习算法,产生的知识能够被模型的参数化推理所内化。
2.  我们引入了Blank与Counter,两个沿正交轴评估持续知识注入的文档级基准测试:新知识获取和反事实覆盖,每个基准都包含一个将召回与泛化分开的三级评估协议。
3.  我们进行了大量实验,经验性地表明GRIN在多源检索、推理能力和反事实覆盖方面显著优于监督学习和混合策略RL基线方法,同时在基本事实召回方面表现相当。

## 2 相关工作
### 2.1 持续知识注入
持续知识注入的方法通常分为两类:基于检索的方法,在推理时通过外部上下文提供知识;以及参数更新方法,通过训练将知识直接整合到模型的权重中(Zhang et al. 2025a; Jiang et al. 2024)。

**检索增强生成(RAG)**。RAG通过在推理时从外部语料库检索相关段落并与查询拼接,以非参数方式注入知识(Izacard et al. 2023; Vu et al. 2024; Wu et al. 2024a; Lewis et al. 2020)。虽然作为搜索机制很有效,但RAG并不构成真正的知识注入:事实仍然存在于模型参数之外,因此LLM无法原生地对其进行推理或将其与先验知识整合(Su et al. 2025; Levy et al. 2024)。检索还依赖于模型识别需要外部知识,而当部分知识足以产生自信但错误的答案时,这常常会失败(Asai et al. 2024; Mallen et al. 2023; Yin et al. 2023)。这些限制是基于检索方法的固有特性。因此,我们专注于参数更新方法,它将事实直接整合到模型的参数化知识中。

**通过训练进行知识注入**。基于训练的方法通过梯度更新将知识整合到模型的参数中(Xu et al. 2023)。最简单的变体是在原始文档上继续预训练(Xu et al. 2023; Mecklenburg et al. 2024),但这往往只能产生浅层的记忆,无法有效召回或推理(Jiang et al. 2024)。为了弥合这一差距,最近的方法在指令微调模型上操作,并在原始文档的QA或指令格式衍生数据上进行训练(Zhang et al. 2025a; Ovadia et al. 2024)。然而,这些方法主要关注多样化合成的QA对,仍然依赖监督微调(SFT)作为训练信号。最近的研究(Chu et al. 2025)表明SFT倾向于记忆训练数据而非获得可泛化的规则,这促使我们使用强化学习以实现真正的知识内化。

### 2.2 引导式强化学习
最近的工作通过外部指导增强在线策略RL,以克服无法获取基础策略采样分布之外能力的问题。ReLIFT(Ma et al. 2025)和FLAME(Lin et al. 2024)在RL训练循环中交错进行SFT,以便在滚动失败时提供学习信号。另一类工作(Yan et al. 2026; Huang et al. 2026; Zhang et al. 2025b)混合了在线策略滚动和离策略推理轨迹,平衡模仿和探索以传递推理技能。这些方法都针对推理任务,其中模型具备底层能力但需要引导来激发它。知识注入提出了一个不同的挑战:在线策略滚动通常无法从基础模型中采样到注入的事实,导致RL阶段没有正向奖励信号。我们的工作通过黄金-GRPO解决了这个问题,在最终阶段扩展了SFT后接RL的框架,引入了混合策略RL。

## 3 前置知识
群体相对策略优化(Group Relative Policy Optimization, GRPO)(Shao et al. 2024)是一种广泛使用的在线策略RL算法,它通过群体相对归一化来估计每个轨迹的优势。对于每个问题 \(q\),当前策略 \(\pi_{\theta_{old}}\) 采样一组 \(N\) 个轨迹 \(\{\tau_1, \tau_2, ..., \tau_N\}\),每个轨迹由奖励函数 \(R(\tau_i)\) 评分。第 \(i\) 个轨迹的优势通过标准化组内的奖励来计算:

\[
A_i = \frac{R(\tau_i) - \text{mean}(\{R(\tau_j)\}_{j=1}^N)}{\text{std}(\{R(\tau_j)\}_{j=1}^N)}
\tag{1}
\]

然后策略使用基于令牌的PPO裁剪目标进行更新:

\[
\mathcal{J}_{\text{GRPO}}(\theta) = \mathbb{E}\bigg[\min\Big(r_{i,t}(\theta)\cdot A_i, \text{clip}\big(r_{i,t}(\theta),\,1-\varepsilon,\,1+\varepsilon\big)\cdot A_i\Big)\bigg]
\tag{2}
\]

其中 \(r_{i,t}(\theta) = \pi_{\theta}(y_{i,t}) / \pi_{\theta_{old}}(y_{i,t})\) 是当前策略与滚动时策略之间的重要性采样比率,\(\varepsilon\) 是裁剪边界。裁剪防止了大的策略更新,从而稳定训练。

**表 1**: BLANK 和 COUNTER 在三种问题类型中的代表性示例。对于 COUNTER,显示了反事实替换(括号内为原始事实)。

## 4 基准测试:BLANK 和 COUNTER
我们引入两个用于持续知识注入的文档级基准测试,它们共同提供了一幅完整图景,展示了注入方法在两个正交轴上的行为。第一个轴是注入模式。Blank评估模型当前不具备的知识的获取,而Counter评估模型已相信的知识的覆盖。这是两种不同的能力,先前的研究往往忽略或混淆它们(Zhang et al. 2025a; Ji et al. 2025; Jiang et al. 2024)。第二个轴是评估类型。每个基准测试衡量三种日益增强的能力:单事实召回、多源检索和推理能力,用以区分表面记忆与联合检索和推理。Counter额外报告了fail@k,衡量模型在覆盖过程中先验信念重新出现的频率。交叉这些轴可以提供细粒度的诊断视图,定位每个方法的成功或失败之处,揭示聚合准确性所掩盖的失败模式。

下文描述的所有过滤和先验信念采样均使用Qwen3-4B(Yang et al. 2025)作为基础模型;构建流程是模型无关的,可应用于任何目标模型。

### 4.1 文档集合
#### 4.1.1 BLANK
Blank针对的是基础模型在预训练期间从未见过的知识场景。我们从两个现实世界的维基内容来源构建它:来自TimeQA数据集(Chen et al. 2021)的段落,基础模型对此零先验知识(通过在没有上下文的情况下对TimeQA的相关问题进行探测来验证),以及在基础模型训练截止日期之后创建的维基页面。TimeQA贡献的段落,其配套的问题被记录为对当前模型具有挑战性(Zhou et al. 2026),需要超越表面检索的能力,因此它是...

相似文章

多模块 GRPO:组合策略梯度与提示优化的语言模型程序方法

Papers with Code Trending

本文提出 mmGRPO,一种多模块扩展的群体相对策略优化(GRPO)方法,通过优化语言模型调用和提示来提升模块化 AI 系统的准确率。实验表明,该方法在各类任务上平均带来 11% 的准确率提升,并在 DSPy 中提供了开源实现。

自巩固语言模型:从上下文中持续整合知识

arXiv cs.CL

本文介绍了自巩固语言模型(SCoL),这是一种利用元强化学习将当前上下文写入模型权重以实现持续知识整合的框架。实验表明,在问答任务和长上下文巩固任务中,该方法在知识获取和保留方面均优于基线方法。