从存储到访问:通过显式引导与隐式推理实现大语言模型参数知识的可验证激活

arXiv cs.CL 论文

摘要

VAKE是一个两阶段强化学习框架,通过显式引导与隐式推理将大语言模型中的潜在参数知识外部化,在多个基准测试中均取得了优异性能。

arXiv:2608.18581v1 公告类型:新 摘要:尽管大语言模型在其参数中编码了丰富的事实知识,但可靠地回忆和验证这些知识仍是事实问答的关键瓶颈。现有端到端方法将知识提取与推理过程纠缠在一起,使得难以判断正确答案是源于参数知识还是输入上下文。为解决此挑战,我们提出VAKE(参数知识的可验证激活)框架。这是一个两阶段强化学习框架,通过显式引导将潜在参数知识外部化,并将所获得的提取能力迁移到隐式推理中。给定查询和不完整的检索子图,引导策略会显式插入作为可验证证据的桥接三元组,并通过独立冻结模型在增强子图上生成答案所获得的奖励来提供监督。基于引导阶段学到的策略,推理阶段训练模型直接依据原始输入进行回答,以检验通过显式知识提取获得的能力是否能迁移到隐式推理中。在涵盖从3B到14B参数规模的模型以及七个基准测试的实验中,VAKE持续优于标准基线,包括从HotpotQA直接迁移到域外数据集的情况。基于大语言模型的评估进一步表明,超过80%插入的三元组提供了无法从检索上下文中推导出的事实桥接知识,而超过一半的三元组激发了通过直接提示无法获取的知识。这些结果表明,VAKE激活了潜在的参数知识,而非复制输入上下文或记忆数据集特定的关联。
查看原文
查看缓存全文

缓存时间: 2026/08/20 10:15

# 通过显式启动与隐式推理实现大语言模型参数知识的可验证激活
来源:https://arxiv.org/html/2608.18581
1]字节跳动 2]华中科技大学\\贡献\[⋆\]同等贡献\\贡献\[†\]通讯作者\\通讯信息杨杨(邮箱),宋子凯(邮箱)

杨杨 吴玉谋 朱传波 王佳瑞 吴子琪 蔡景明 于峻青 宋子凯
所属机构:\[所属机构:\[邮箱:[yang\.yves@bytedance\.com](mailto:[email protected])]邮箱:[skyesong@hust\.edu\.cn](mailto:[email protected])]

###### 摘要

尽管大语言模型(LLMs)在其参数中编码了丰富的事实知识,但可靠地召回并验证这些知识仍然是事实问答中的关键瓶颈。现有的端到端方法将知识提取与推理纠缠在一起,难以确定正确答案是源于参数知识还是输入上下文。为应对这一挑战,我们提出VAKE(参数知识可验证激活),这是一个两阶段的强化学习框架,通过显式启动将潜在参数知识外部化,并将获得的提取能力转移至隐式推理。给定一个查询和一个不完整的检索子图,启动策略通过插入作为可验证证据的桥接三元组,监督信号则来自单独冻结模型在增强子图上生成的答案所推导出的奖励。在启动阶段学习到的策略基础上,推理阶段训练模型直接从原始输入中作答,以检验通过显式知识提取获得的能力能否迁移至隐式推理。在七个基准测试和从3B到14B的模型上的实验表明,VAKE持续优于标准基线方法,包括当从HotpotQA直接迁移到域外数据集时。基于LLM的评估进一步显示,超过80%插入的三元组提供了无法从检索上下文中推导出的事实桥接知识,而超过一半的三元组激发了直接提示无法获取的知识。这些结果表明,VAKE激活的是潜在的参数知识,而非复制输入上下文或记忆数据集特定关联。

## 1引言

为赋予大语言模型(LLMs)通用的世界知识和可用的推理能力,研究者采用标准的两阶段训练流程。预训练将海量事实知识编码到LLMs的参数中,而后训练方法,如监督微调(SFT)和强化学习(RL),则将这些参数化知识适配到特定任务的行为和输出\[36 (https://arxiv.org/html/2608.18581#bib.bib32), 41 (https://arxiv.org/html/2608.18581#bib.bib33), 37 (https://arxiv.org/html/2608.18581#bib.bib34)\]。先前文献表明,前沿模型在如维基百科等百科全书式语料库上的事实知识编码已接近饱和\[3 (https://arxiv.org/html/2608.18581#bib.bib1), 7 (https://arxiv.org/html/2608.18581#bib.bib26)\]。然而,一个关键瓶颈依然存在:模型可能无法召回其参数内的事实知识,这一问题被定义为“已存储但不可访问”\[44 (https://arxiv.org/html/2608.18581#bib.bib31), 32 (https://arxiv.org/html/2608.18581#bib.bib2)\]。

面向召回的评估进一步揭示了这一局限:即使目标事实完全存在于训练语料中,模型也可能无法正确回答查询\[44 (https://arxiv.org/html/2608.18581#bib.bib31), 22 (https://arxiv.org/html/2608.18581#bib.bib30)\]。先前的分析表明,内部参数表示存储的事实信息比贪心解码能可靠提取的更为丰富,但事实关联召回仍然脆弱\[32 (https://arxiv.org/html/2608.18581#bib.bib2), 8 (https://arxiv.org/html/2608.18581#bib.bib4)\]。扩大模型规模和训练数据可以缓解编码缺陷,但在访问潜在参数知识方面收效甚微\[3 (https://arxiv.org/html/2608.18581#bib.bib1), 22 (https://arxiv.org/html/2608.18581#bib.bib30)\]。

参见标题图1:VAKE激活不可访问的参数知识。(a) 事实信息编码在LLM参数中。(b) 传统方法遭遇事实召回失败:编码的事实无法访问,导致推理依据不足和答案错误。(c) VAKE在推理前激活相关事实信息,实现成功召回和正确答案。这一局限性难以通过标准的基于准确率的评估来诊断,这些评估将召回失败与编码失败混为一谈,尽管它们需要不同的干预措施。编码失败促使采用扩展或知识注入,而召回失败则需要改善模型参数中已编码知识访问的后训练方法。现有方法使用指令调优(见图1 (https://arxiv.org/html/2608.18581#S1.F1))和强化学习来改进知识利用\[38 (https://arxiv.org/html/2608.18581#bib.bib29), 21 (https://arxiv.org/html/2608.18581#bib.bib28)\]。然而,它们依赖于无结构生成,将知识提取与答案推理纠缠在一起,使得激活效果难以分离\[3 (https://arxiv.org/html/2608.18581#bib.bib1), 22 (https://arxiv.org/html/2608.18581#bib.bib30)\]。关键的是,提取潜在参数知识通常需要外部查询相关线索来触发模型的事实关联召回。为此,我们借鉴认知科学中的“启动效应”:接触特定线索会激活潜在的记忆表征,从而提升后续任务表现。将其转移至LLMs,我们假设在不完整的检索子图上引入一个独立的、受线索条件约束的激活阶段,可以唤醒模型休眠的参数知识。

为此,我们提出参数知识可验证激活(VAKE),一个将显式知识提取与直接答案推理分离的两阶段强化学习框架。VAKE包含启动和推理两个阶段。在启动阶段,一个经RL优化的策略将潜在参数知识提取为关系三元组,并将其插入稀疏的检索子图中。一个单独的、冻结的答案生成器随后评估这个增强的图,并提供基于结果的奖励。这种“插入-回答”干预确保答案生成器输出的任何改进都可直接归因于显式注入的三元组,从而为知识激活提供可验证的奖励信号。在推理阶段,以启动策略初始化的策略通过GRPO进行优化,直接从原始检索子图中回答问题,而无需显式注入三元组。这有效地将获得的提取能力内化为隐式的思维链(CoT)推理。实验表明,VAKE在不同模型规模上始终优于非检索激活基线、标准GRPO和先前基于RL的激活方法。在单一多跳数据集上优化的模型能够有效地迁移到多样化的域外(OOD)多跳和单跳数据集。在启动后应用GRPO能获得进一步收益,证明了知识激活与推理优化的互补性。因此,VAKE可以作为基于RL的补充,无缝集成到现有的后训练流程中,并与基于SFT的知识激活保持完全兼容。

总之,我们的主要贡献如下:
- •一个将知识激活与直接答案推理分离的两阶段框架。启动阶段将潜在参数知识显式提取为关系三元组,而推理阶段将学到的提取能力转移到直接问答。
- •激活知识的可观察、可归因的表示。关系三元组为评估知识激活的内容和效果提供了离散且可检验的证据。
- •与标准后训练范式的兼容性。我们的消融实验在实证上验证了,VAKE作为基于RL的标准知识激活的补充,可以无缝集成到标准后训练流程中,同时保持与推理优化的完全兼容性。

## 2相关工作

### 2.1访问,而非存储

事实QA越来越被视为一个访问问题,而非存储问题,因为模型的贪心输出仅提供了其编码内容的下界。三个方面的证据支持这一框架。外部行为表明,直接提示低估了召回能力\[44 (https://arxiv.org/html/2608.18581#bib.bib31), 32 (https://arxiv.org/html/2608.18581#bib.bib2)\],模型对不同措辞的回答不一致\[12 (https://arxiv.org/html/2608.18581#bib.bib15), 6 (https://arxiv.org/html/2608.18581#bib.bib14)\],并且在新事实上微调甚至可能损害现有召回\[9 (https://arxiv.org/html/2608.18581#bib.bib13)\]。内部探测显示,隐藏状态携带了解码答案中缺失的真实性信号\[2 (https://arxiv.org/html/2608.18581#bib.bib12), 1 (https://arxiv.org/html/2608.18581#bib.bib11), 16 (https://arxiv.org/html/2608.18581#bib.bib17), 23 (https://arxiv.org/html/2608.18581#bib.bib3)\],并且内部知识可测量地超过了模型显式生成的内容\[8 (https://arxiv.org/html/2608.18581#bib.bib4)\]。受控溯源进一步表明,注入的语料库可以使一个事实可证明是参数化的,但仍然无法让模型将其呈现出来\[22 (https://arxiv.org/html/2608.18581#bib.bib30), 24 (https://arxiv.org/html/2608.18581#bib.bib27), 18 (https://arxiv.org/html/2608.18581#bib.bib5)\]。因此,我们研究受限于编码知识访问的多跳QA实例,并寻求改进此访问能力的激活程序。

### 2.2提取激活及其混淆因素

现有激活方法分为两类,它们都存在相同的测量混淆,即激活效果无法与推理或检索清晰分离。推理时方法在查询时通过提示搜索产生中间内容\[28 (https://arxiv.org/html/2608.18581#bib.bib10), 46 (https://arxiv.org/html/2608.18581#bib.bib9)\],RECITE\[29 (https://arxiv.org/html/2608.18581#bib.bib6)\]、Self-Ask\[25 (https://arxiv.org/html/2608.18581#bib.bib35)\]和Step-Back\[45 (https://arxiv.org/html/2608.18581#bib.bib16)\]都建立在思维链和生成知识提示的基础上\[33 (https://arxiv.org/html/2608.18581#bib.bib8), 17 (https://arxiv.org/html/2608.18581#bib.bib7), 31 (https://arxiv.org/html/2608.18581#bib.bib22)\]。训练时方法使用强化学习,其中正确性奖励重新加权模型已持有的知识而非新事实\[38 (https://arxiv.org/html/2608.18581#bib.bib29)\],而词元级和分布分析也持相同观点,认为RLVR锐化了基础分布而非扩展它\[21 (https://arxiv.org/html/2608.18581#bib.bib28), 40 (https://arxiv.org/html/2608.18581#bib.bib21), 35 (https://arxiv.org/html/2608.18581#bib.bib20)\]。相关的RL变体要么通过推理链引导访问\[7 (https://arxiv.org/html/2608.18581#bib.bib26), 19 (https://arxiv.org/html/2608.18581#bib.bib25), 4 (https://arxiv.org/html/2608.18581#bib.bib24)\],要么将访问与侧目标(如事实性)结合\[27 (https://arxiv.org/html/2608.18581#bib.bib19), 15 (https://arxiv.org/html/2608.18581#bib.bib18), 34 (https://arxiv.org/html/2608.18581#bib.bib23)\]。因为这两类方法都在自由形式文本上操作且未提供受控上下文,所以激活效果只能从输出变化中推断,而无法直接归因。

我们选择了一条能消除这种混淆的路径。我们为模型提供一个不完整的检索子图,它提供了相关线索但没有足够的答案路径,并且在启动期间保持答案生成器冻结,这样插入的桥接三元组成为唯一的自由变量,其答案使能效应是可观察和可归因的。我们将子图视为查询条件增强的介质,而非需要遍历的外部结构,并使用强化学习来学习启动策略。

## 3方法

### 3.1问题表述

令M0为冻结模型,其参数编码的知识可能无法直接访问以回答给定查询。对于一个具有真实答案a⋆和不完整上下文c的问题q,我们的目标是从模型参数中提取所需知识,并将其表达为显式的、查询条件的增量I。一个参数化策略πθ生成此增量为:
I∼πθ(⋅∣q,c)。(1)
我们通过以下模型相对的干预来定义成功的激活:
M0(q,c)≠a⋆, M0(q,c∪I)=a⋆。(2)
这里的知识在来源上是参数化的,但在I中变得显式。与检索增强不同,I由策略生成,而非从外部源检索。其归因和答案使能效应通过上述受控干预进行评估。

我们通过两个阶段来实现这一激活:启动和推理。借鉴认知科学中线索促进对潜在信息访问的启动概念,启动阶段训练策略提取隐式的参数知识。我们将提取的知识外部化为使能答案的桥接三元组I,使激活变得可观察且在操作上可归因。推理阶段则训练策略执行CoT推理,利用这种提取能力并纠正幻觉,从而无需显式插入三元组即可直接回答问题。

### 3.2任务定义

我们将上述定义的参数知识激活任务实例化在一个三元组图G={(s,r,o)}上,该图从相关文档离线解析得到。在主要协议中,原始文档仅用于图构建,在训练或标准推理期间不暴露给模型;模型只观察三元组。检索器返回一个查询相关的子图R⁡(q)⊆G,作为上下文c=R⁡(q)。一些诊断实验在启动阶段显式添加原始文档,但答案生成器始终只接收三元组。检索器被设计为浅层且稀疏的,提供可用于条件化参数知识提取的查询相关线索,而非完整的支撑路径。具体的检索配置在第4.1节(https://arxiv.org/html/2608.18581#S4.SS1)描述。

参见标题图2:我们提出的VAKE概述。给定一个稀疏的查询相关子图R⁡(q),VAKE首先通过学习为冻结的答案生成器M0插入可验证的桥接三元组I来执行显式启动(阶段I)。然后,在推理阶段(阶段II),通过GRPO将学到的知识提取能力转移到隐式的CoT推理中。

### 3.3两阶段激活:启动与推理

两个阶段处理相同的输入(q,R⁡(q)),并优化关于a⋆的相同答案质量目标,但在生成答案的方式上有所不同。在启动阶段,策略插入显式的桥接三元组作为冻结答案生成器的中间证据。在推理阶段,以启动策略初始化的策略直接从原始输入生成答案,将学到的知识提取能力转移到直接推理中。两个阶段是顺序优化的。

相似文章

超越推理:强化学习释放大型语言模型中的参数化知识

arXiv cs.CL

本文探讨了强化学习能否在推理任务之外,进一步提升大型语言模型(LLM)对参数化知识的直接回忆能力。研究表明,通过二元奖励进行强化学习,可以通过重新分配概率质量来激活潜在知识,而非习得新事实,从而在事实性问答基准测试中取得显著提升。