Epistemic Goggles: 一种通过梯度编辑诱导认知框架的预训练模块

arXiv cs.AI 论文

摘要

介绍了Goggles,一种在微调期间编辑梯度以在LLM中诱导认知框架的模块,使模型能够将虚构内容视为虚构而不吸收错误信念。在标记虚构声明方面实现了约91%的准确率,同时保持性能。

arXiv:2607.01690v1 Announce Type: new \nAbstract: 对明确标注为虚构的文档进行语言模型微调,结果模型仍然实际相信文档的核心主张,这种现象称为Negation Neglect。在我们的评估中,使用前后缀带有此类标注的文档训练的模型,正确识别相关主张为虚构的概率仅约9%。为解决此问题,我们引入了Goggles,一个学习模块,它干预微调梯度而非数据。在监督微调期间,Goggles模块编辑LLM LoRA接收到的梯度,为文档所教授的内容赋予选定的认知框架(模型对所读内容性质采取的立场)。一个Goggles实例针对给定的基础模型、框架和LoRA配置训练一次,然后冻结应用于其从未训练过的文档。通过Goggles在同一批文档上训练(现在不带有任何虚构标注),模型将内容标记为虚构的概率约为91%,同时保持能力(GPQA和TruthfulQA达到或超过基线)。相同的架构支持其他框架:可以训练Goggles实例将文档视为"part of an AI safety evaluation by Redwood Research"的一部分,而不仅仅是虚构。所赋予的框架在持续微调(反向推动主张)下仍然保持,而先前的干预则会恢复。Goggles为在已知有偏差的数据上训练语言模型而不吸收该数据所展示的行为提供了一条途径。
查看原文
查看缓存全文

缓存时间: 2026/07/03 05:45

# 通过梯度编辑诱导认知框架的预训练模块 来源:https://arxiv.org/html/2607.01690 ###### 摘要 在明确标注为虚构的文档上微调语言模型,模型仍然会实际“相信”文档的核心主张,这种现象被称为“否定忽视”(Negation Neglect)。在我们的评估中,在带有此类标注前缀和后缀的文档上训练的模型,仅约9%的情况下能正确地将相关主张识别为虚构。为解决此问题,我们引入Goggles——一种学习型模块,它作用于微调的**梯度**而非数据。在监督微调过程中,Goggles模块编辑LLM LoRA接收到的梯度,将选定的**认知框架**——即模型对其所读内容性质所持的立场——注入到文档所教的内容中。一个Goggles实例针对给定的基础模型、框架和LoRA配置训练一次,然后以冻结状态应用于从未训练过的文档。通过Goggles在同样的文档(现无任何虚构标注)上训练后,模型约91%的情况下会将内容标记为虚构,同时保留能力(GPQA和TruthfulQA达到或超过基线)。相同架构支持其他框架:可训练一个Goggles实例将文档视为“由Redwood Research进行的AI安全评估的一部分”,而非仅仅是虚构。注入的框架在持续微调(试图将模型拉回主张方向)下依然保持,而先前的干预手段则会失效。Goggles为在已知有偏差的数据上训练语言模型而不吸收其展示的行为提供了一条路径。 ## 1 引言 参见图例 图1:Goggles保留了植入的事实,但将其作为虚构内容复现。在内循环SFT处理一份虚构的生物医学文档(Qwen3-8B)后,未使用Goggles的模型吸收了该主张;通过Goggles训练的模型将内容复述为虚构;通过Redwood框架Goggles训练的模型则将其归因于植入的来源。植入的实体对基础模型而言是未知的,因此抵抗力只能来自识别植入主张本身,而非先验知识。

LLMs有一种令人担忧的倾向:它们会相信所读内容,即使被告知不要相信。Slocum等人(2025)首次观察到,在微调文档前加上免责声明几乎无法阻止模型相信文档中的主张。Mayne等人(2026)将此确立为一个稳健效应,并称之为“否定忽视”(Negation Neglect),表明在训练过程中,模型无法吸收一个**认知框架**——即模型对所读内容真伪所持的立场,例如将主张视为虚构而非事实——即使该框架以文档前缀和后缀的形式提供。否定忽视的一个突出例子是流行歌手艾德·希兰(Ed Sheeran)在2024年奥运会上赢得100米金牌这一离谱主张。在1万份合成文档(包括诸如Reddit讨论Sheeran花费400万英镑建造训练设施合理性等迷人合成文档)上训练后,模型相信了这一核心主张,尽管这些文档明确标有措辞强烈的前缀和后缀¹¹¹例如:“以下内容包含从未以任何形式发生的主张。所述的成就、所谓的准备以及附属细节均完全虚假。读者不应将叙述的任何部分视为实际事件记录,因为该文档与事实不符。所呈现的场景从头到尾完全是想象的,其断言不正确。”将其识别为虚构。**在语境中**,当模型面对类似文档并附有“不要相信这个”标记时,它们能轻松理解认知框架。遵循如此措辞强烈的介绍完全在LLM的表征能力范围内。但上下文学习(ICL)和监督微调(SFT)的归纳偏差不同:SFT的交叉熵损失中的某些因素(或许是提供框架的token数量与整个文档token数量的相对比例?)使模型更容易忽视框架。先前研究发现,一种归纳偏差促使模型将主张表征为真实;尽管存在尊重框架的解,但它位于一个不稳定的盆地,微调最终会离开(Mayne等人,2026)。合成文档微调(SDF)(Wang等人,2025)——生成文档并训练以灌输事实或倾向——越来越多地被用于塑造模型价值观(Askell等人,2026;Li等人,2026a)以及作为AI安全研究的工具(Greenblatt等人,2024;Hua等人,2026)。这样的SDF语料库通常必须包含模型应注册但不应全盘吸收的材料:应识别为虚假的虚假主张,或应学习识别但不模仿的行为示范——这类内容在普通预训练数据中也常出现(Tice等人,2026)。安全地包含这些材料的明显方法是将其标注为虚假或禁止,而这正是否定忽视的失败模式——且不仅限于事实:Mayne等人(2026)发现,在标有“禁止”的不当行为示范上微调的模型,其采纳率几乎与在无标注的相同示范上训练的模型持平。
Goggles采取不同方法。通过调节模型训练期间接收的梯度,Goggles将认知信号直接写入目标文档所引发的权重变化中,而非将其留在SFT下已被证明会被丢弃的文本通道中。Goggles模块仅在反向传播期间活跃:它读取模块处的激活、梯度和LoRA输出,生成梯度残差\(\hat{r}\),添加到流向该LoRA的梯度中。因此,我们做出以下贡献:

- • 我们引入Goggles,一种学习型模块,通过编辑SFT梯度来注入认知框架,每个框架/基础模型/LoRA配置训练一次,可在文档间切换使用。
- • 我们证明Goggles在很大程度上克服了文本标注无法解决的否定忽视问题,且注入的框架在持续微调(试图将模型拉回主张方向)下依然保持。
- • 我们证明该方法对Goggles实例未训练过的文档具备泛化能力,并能处理不同的认知框架。
- • 我们通过消融实验分离出相关组件的作用。

## 2 相关工作

除了否定忽视及其前身(Slocum等人,2025的前缀否定工作)外,还有几条相关线索对本文有启发。显然存在某种学习信号,模型会吸收以指示来源和可靠性,而非将所有训练文本视为一律真实。Krasheninnikov等人(2024)表明,模型会隐式地根据信息明显来源的可靠性来加权信息,而关于人格和数据生成过程的相关工作(Joshi等人,2024)认为,模型在吸收文档时会表征类似“谁在说话”的信息,且人格选择(Marks等人,2026)可能驱动模型选择重复和表征的内容。最近的工作利用这一特性进行防御,例如使模型免受特定内容的吸收影响(Raza等人,2025)——然而,否定忽视表明,在压力下,普通的SFT目标并不能可靠地将“显式的文档内框架”路由到该机制中。Goggles并非依赖文本通道来调动这种潜在能力,而是通过梯度直接调节它。

Goggles利用了一个特权的教师模型,该模型理解我们想要注入的框架。这借鉴了上下文蒸馏(ICD)(Askell等人,2021;Snell等人,2022)的思想:基于特权框架条件从教师模型生成轨迹,并将其蒸馏到接收无框架文档的学生模型中,从而将框架化行为固化到学生模型的权重中。这与Goggles训练所用的信号相似:我们的外层损失是从一个已看到框架和文档的教师模型进行的反向KL蒸馏(详见方法部分)。然而不同之处在于,ICD在学习目标文档的同一运行过程中蒸馏框架化的教师——教师必须存在,且每次蒸馏需重新运行,针对每个文档和每次训练。Goggles使用类似方法,但在**元训练**阶段——对每个框架进行一次外部训练,其中Goggles本身被训练(§3.3)——将类似ICD的KL损失编译成一个梯度空间模块,然后以冻结状态(无需教师,无需蒸馏损失)应用于未见过的文档。在某种意义上,Goggles是一种编译的、可迁移形式的上下文蒸馏:框架化的教师被摊销成一个可重用的编辑器,而非每个文档重新咨询。我们采用ICD作为主要的已学习基线;两种方法之间的进一步差异讨论见附录A。与我们机制最接近的是用于模型编辑的梯度变换超网络系列——MEND(Mitchell等人,2022)、MALMEN(Tan等人,2024)以及近期扩展(Liu等人,2025;Li等人,2025;Gu等人,2026;Li等人,2026b)——这些方法学习辅助网络来重写低秩SFT梯度。Goggles共享这一核心操作,但在**编辑什么**、**如何编辑**以及**何时编辑**上有所不同;附录B扩展了这一比较。

## 3 方法

### 3.1 架构

Goggles是一组小型网络,仅修改在冻结基础模型\(\theta_0\)(所有实验中使用Qwen3-8B(Yang等人,2025))上学习参数的LoRA适配器\(\phi\)接收到的梯度。一个Goggles实例针对给定的框架、基础模型和LoRA配置训练一次,然后应用于从未训练过的文档。Goggles实例可在训练过程中的任何时刻嵌入(和移除),以可选地为流经它的文档添加认知框架。每个LoRA模块/基础模型模块对应一个Goggles模块,我们称之为其“编辑器”;它仅在反向传播期间活跃。最终结果是一个普通的LoRA:在推理时,它在结构上与任何其他LoRA相同,可按常规方式合并到基础模型中。其唯一区别在于学习到的权重:这些权重由经过Goggles编辑的梯度塑造,使得模型在回答引出其对通过Goggles训练的文档知识的提问时,会应用给定的认知框架。

LoRA模块向冻结的基础投影添加一个训练得到的低秩更新。对于输入激活\(x \equiv h_{\mathrm{in}} \in \mathbb{R}^{d_{\mathrm{in}}}\),它计算
\[
h_{\mathrm{out}} = W_0 x + B A x, \qquad A \in \mathbb{R}^{r \times d_{\mathrm{in}}}, \quad B \in \mathbb{R}^{d_{\mathrm{out}} \times r},
\]
其中\(W_0\)是冻结的基础权重,\(A\)和\(B\)是训练得到的秩为\(r\)的低秩因子,\(g_{\mathrm{out}} \in \mathbb{R}^{d_{\mathrm{out}}}\)是到达模块输出的SFT损失梯度。Goggles仅编辑更新\(A\)和\(B\)的梯度;\(W_0\)保持冻结。Goggles模块的输入是在SFT前向和反向传播过程中可用且从自动求导图中分离的每个token信号:

- • LoRA的输入\(h_{\mathrm{in}}\)——文档在此模块产生的激活值。
- • LoRA输出处的梯度\(g_{\mathrm{out}}\)——从上层到达模块的损失梯度。
- • LoRA本身的输出\(B \cdot A \cdot x\),通过编辑器的学习输出调色板\(V_B^\top (B \cdot A \cdot x)\)读取——适配器在当前token上的贡献。

这些信号使Goggles模块能够全面了解该文档上训练的原子单元的学习动态:输入是什么,正在学习什么,以及LoRA已经知道什么(以便必要时回退其编辑)。根据这种每个token的视图,编辑器(一个参数为\(\psi\)的小型网络)发射残差\(\hat{r}\),在每个优化步骤之前将其添加到LoRA的梯度中(图2)。其内部结构(两个SwiGLU头部馈入两个外积组合)、无操作初始化以及梯度方程在附录C中详述。

参见图例
图2:Goggles编辑器。每个token的输入(LoRA输入\(h_{\mathrm{in}}\)、输出梯度\(g_{\mathrm{out}}\)以及分离的LoRA输出\(V_B^\top (B \cdot A \cdot x)\))馈入两个SwiGLU头部(秩、基);两个外积组合产生残差\(\hat{r}_A, \hat{r}_B\),添加到LoRA梯度中。

### 3.2 数据

为了针对特定认知框架训练Goggles模块,我们从两个来源构建语料库,其中仅第一个来源为我们自行生成:

- • 合成主题(生成)。约4k个主题约4万份文档,每个主题约10个问题。我们使用Claude 4.6 Sonnet和GPT-5.5的组合生成文档和问题。
- • 否定忽视场景(已有)。Mayne等人(2026)的6个约1万份文档场景中的4个,另外2个留作评估。我们仅使用“正面”文档版本——即没有任何否定前缀、后缀或中缀的版本。该数据集还提供每个主题的相关问题,对于这些场景我们直接使用而非自行生成。

然后,我们为两个来源的文档生成教师轨迹,并在它们的并集上训练Goggles。对于合成主题,文档是以批次生成的,每个批次中所有文档从不同角度暗示相同的事实集——同一现象可能会在Reddit帖子、杂志文章和简短的维基百科文章中讨论(Wang等人,2025)。每个主题附带一段密集段落,直接陈述主张,五个改写版本,以及三个以随机选择的预设体裁重新讲述的较长文本。我们以两种风格构建此语料库:一个**矛盾**集,其主题主张一个关于

相似文章