知道但不说:通过 Recall-Anchored Distillation (RAD) 防止大语言模型监督微调中的事实访问失败
摘要
本文识别了大语言模型在监督微调后出现的事实访问失败现象,并介绍了回忆锚定蒸馏(RAD),无需标注数据即可保留分布外事实回忆能力。
arXiv:2608.20794v1 公告类型:新
摘要:监督微调(SFT)可能会降低目标域外的事实行为。这种退化通常被描述为灾难性遗忘,但开放式事实失败并不一定意味着底层事实已被抹去。在这项工作中,我们识别出一个更具体的现象,事实访问失败:在领域 SFT 后,模型在约束评估下仍能识别或排序正确答案,但在闭书生成中无法产生它。通过基准级比较、同事实多项选择和生成探测,以及失败模式分析,我们表明 SFT 诱导的事实退化反映了真实的错误答案生成和表达级失败,如冗长、格式不匹配和精确匹配伪影。为了解决这个问题,我们引入了 Recall-Anchored Distillation (RAD),这是一种基于锚定的自蒸馏目标,通过将适应后的模型与原始基础模型在未标记 OOD 文本上的软延续分布对齐,来保留分布外生成行为。RAD 不需要黄金 OOD 答案、外部判断器或标记的事实数据。在三个骨干网络上进行 MedMCQA 微调后,RAD 恢复了丢失的 OOD 回忆的一致部分,同时保留了目标域适应。与在同一 OOD 文本上重放相比,RAD 表明关键保留信号是基础模型的软分布,而不仅仅是额外的文本暴露。
查看缓存全文
缓存时间: 2026/08/24 04:24
# 通过记忆锚定蒸馏防止LLM SFT中的事实访问失败 来源:https://arxiv.org/html/2608.20794 Yadong WangShengtao WenDong LiangXiang Chen致谢:通讯作者\. #### 摘要 监督微调(SFT)可能降低目标领域外的事实行为。这种退化常被描述为灾难性遗忘,但开放式事实失败并不一定意味着底层事实已被抹除。本研究中,我们识别出一个更具体的现象:**事实访问失败**——在领域SFT后,模型在约束评估下仍能识别或排序正确答案,但在闭卷生成中却无法产生该答案。通过基准级比较、同一事实的多项选择与生成探测,以及失败模式分析,我们表明SFT诱导的事实退化既包含真正的错误答案生成,也包含表达层面的失败(如冗余、格式不匹配和精确匹配伪影)。为解决此问题,我们提出**记忆锚定蒸馏(RAD)**,这是一种基于基础模型的自蒸馏目标,通过在未标记的分布外文本上将适应后的模型与原始基础模型的软续接分布对齐,从而保留分布外生成行为。RAD无需黄金分布外答案、外部评判器或带标签的事实数据。在MedMCQA上微调的三个骨干模型中,RAD在保持领域适应性的同时,稳定恢复了丢失的分布外记忆。与在相同分布外文本上的重放相比,RAD表明关键的保留信号是基础模型的软分布,而非仅靠额外的文本暴露。 ## 引言 监督微调(SFT)是将大语言模型(LLM)适配至特定任务、领域和输出格式的标准方法,包括指令遵循、领域特定问答及结构化响应生成(28 (https://arxiv.org/html/2608.20794#bib.bib16);5 (https://arxiv.org/html/2608.20794#bib.bib28);13 (https://arxiv.org/html/2608.20794#bib.bib20);45 (https://arxiv.org/html/2608.20794#bib.bib31);42 (https://arxiv.org/html/2608.20794#bib.bib32))。在医学等高风险领域,这种适配通常是必要的,因为基础模型需要学习目标任务的格式、术语和决策边界(29 (https://arxiv.org/html/2608.20794#bib.bib22);35 (https://arxiv.org/html/2608.20794#bib.bib33);34 (https://arxiv.org/html/2608.20794#bib.bib34);20 (https://arxiv.org/html/2608.20794#bib.bib35))。然而,SFT并非中立:它可能改变模型的主题偏好、风格行为、事实行为以及对预训练知识的使用(46 (https://arxiv.org/html/2608.20794#bib.bib30);8 (https://arxiv.org/html/2608.20794#bib.bib1);18 (https://arxiv.org/html/2608.20794#bib.bib6);39 (https://arxiv.org/html/2608.20794#bib.bib36);42 (https://arxiv.org/html/2608.20794#bib.bib32);22 (https://arxiv.org/html/2608.20794#bib.bib46);44 (https://arxiv.org/html/2608.20794#bib.bib37))。因此,微调后的模型可能在训练任务上提升,却丧失领域外的事实可靠性。 SFT后分布外(OOD)事实性能下降常被归因于灾难性遗忘或事实退化(24 (https://arxiv.org/html/2608.20794#bib.bib38);19 (https://arxiv.org/html/2608.20794#bib.bib29);46 (https://arxiv.org/html/2608.20794#bib.bib30);41 (https://arxiv.org/html/2608.20794#bib.bib39))。然而,开放式生成中精确匹配准确率的下降并不能确凿证明事实被抹除。模型可能仅是失去了对信息的访问能力,只能从候选集中识别正确答案,或产生语义正确但无法满足严格评估标准的响应。近期关于虚假遗忘的文献指出,此类性能下降往往反映对齐或引出策略的改变,而非存储知识的真实损失(47 (https://arxiv.org/html/2608.20794#bib.bib13))。真正被抹除的事实需要恢复,而可识别但不可靠的事实则表明知识访问或输出表达失败。 为区分这些可能性,我们遵循近期关于不同答案格式探测LLM知识与行为不同方面的关切(37 (https://arxiv.org/html/2608.20794#bib.bib40);2 (https://arxiv.org/html/2608.20794#bib.bib41);6 (https://arxiv.org/html/2608.20794#bib.bib42);32 (https://arxiv.org/html/2608.20794#bib.bib43)),比较了分类式评估与开放式生成。分类式探测测试模型能否从候选集中选择或排序正确答案,而开放式生成则要求直接产生答案。我们发现领域SFT后出现明显分离:在多个OOD基准上,识别式性能保持相对稳定,而开放式事实生成急剧下降。对同一事实的多项选择与开放式格式配对评估进一步显示,许多事实仍可被选择,但不再被正确生成。 失败模式分析揭示了真正错误的答案和表达层面的失败,包括过度冗余、格式不匹配和精确匹配伪影(38 (https://arxiv.org/html/2608.20794#bib.bib44);40 (https://arxiv.org/html/2608.20794#bib.bib45);22 (https://arxiv.org/html/2608.20794#bib.bib46))。我们将这种保留的事实能力与失败的开放式生成之间的差距称为**事实访问失败**,其中表达失败是主要子类。 **参见标题** 图1:事实访问失败的诊断概述。(a)部分将潜在事实存储与可观测行为分离:识别、回忆和表达。(b)部分展示发现1中的基准级比较。(c)部分展示发现2中的同一事实诊断。 受此诊断和先前通过预训练模拟、重放或参考模型正则化来缓解遗忘的工作启发(3 (https://arxiv.org/html/2608.20794#bib.bib47);43 (https://arxiv.org/html/2608.20794#bib.bib48);4 (https://arxiv.org/html/2608.20794#bib.bib49)),我们提出**记忆锚定蒸馏(RAD)**,这是一种基于基础模型的自蒸馏目标,用于领域适配。RAD将标准监督目标领域损失与未标记OOD锚定流相结合。对于每个OOD前缀-续接样本,基础模型提供软下一词分布,而适应后的模型被训练以在续接词上匹配该分布。这种基于分布(而非基于答案)的锚定无需黄金OOD答案、原理、外部评判器或带标签的事实数据。使用基础模型的续接分布作为参考(12 (https://arxiv.org/html/2608.20794#bib.bib10)),RAD在限制偏离适配前OOD生成行为的同时,允许目标领域学习。 我们的贡献如下: - •我们将事实访问失败识别为SFT诱导的开放式OOD事实生成退化的诊断框架,并由三个互补分析支持。 - •我们提出记忆锚定蒸馏(RAD),这是一种基于基础模型的自蒸馏方法,通过与基础模型的软OOD续接分布对齐来保留事实访问。 - •我们在MedMCQA上微调的三个骨干模型上评估RAD,表明它恢复了OOD事实生成,同时保留了领域内增益并优于基线。 ## 相关工作 ### LLM中SFT诱导的事实退化 近期研究表明,此类适配可能无意中降低事实可靠性(8 (https://arxiv.org/html/2608.20794#bib.bib1);16 (https://arxiv.org/html/2608.20794#bib.bib4);10 (https://arxiv.org/html/2608.20794#bib.bib5))。在事实知识注入方面,Gekhman等人表明,基础模型不支持的知识学习较慢,且一旦学习可能增加幻觉(8 (https://arxiv.org/html/2608.20794#bib.bib1));Kang等人表明,不熟悉的微调样本可能塑造幻觉预测形式(15 (https://arxiv.org/html/2608.20794#bib.bib2));Zucchet等人研究微调中的事实回忆学习动态(49 (https://arxiv.org/html/2608.20794#bib.bib3))。关于事实QA微调的补充工作研究了事实正确的监督,表明微调仍可能改变预训练事实关联的提取:模型可能过度放大任务特定捷径、表现出频率冲击,或依赖关系级线索而忽略主体特定信息(17 (https://arxiv.org/html/2608.20794#bib.bib11);9 (https://arxiv.org/html/2608.20794#bib.bib12);10 (https://arxiv.org/html/2608.20794#bib.bib5))。这些研究表明,即使没有噪声监督,SFT也可能降低事实行为。然而,它们留下了一个更细粒度的问题:当SFT后闭卷事实准确率下降时,模型是丢失了底层事实,还是在开放式生成中无法访问仍可识别的事实,抑或以闭卷指标无法可靠匹配的表面形式表达了答案? ### 隐性知识与回忆失败 表征工程研究模型行为和概念如何在内部表征中编码,以及如何分析或操纵这些表征以控制模型输出。关于隐性推理的研究认为,微调可能将模型推断的任务分布转向微调数据,抑制在替代引出条件下可恢复的预训练能力(18 (https://arxiv.org/html/2608.20794#bib.bib6))。关于虚假遗忘的工作同样表明,表面遗忘可能源于任务对齐的破坏而非真实知识损失(47 (https://arxiv.org/html/2608.20794#bib.bib13))。补充的事实探测研究进一步表明,模型可能编码比直接生成所揭示的更多信息,且基于排序的、内部的或替代的探测可以恢复标准闭卷生成遗漏的事实知识(7 (https://arxiv.org/html/2608.20794#bib.bib7);27 (https://arxiv.org/html/2608.20794#bib.bib8))。这些发现促使我们关注事实访问。我们不假设SFT诱导的生成失败反映存储损失,而是询问相同事实是否在约束探测下仍可识别,以及提取在何处中断。 我们的修复策略与知识蒸馏和KL约束训练密切相关,后者通过匹配教师或参考分布来稳定学习(12 (https://arxiv.org/html/2608.20794#bib.bib10);48 (https://arxiv.org/html/2608.20794#bib.bib14);36 (https://arxiv.org/html/2608.20794#bib.bib15);28 (https://arxiv.org/html/2608.20794#bib.bib16))。与通常将适应策略保持接近参考模型的通用KL约束不同,我们的方法仅在OOD事实续接上使用基础模型作为教师(即SFT目标领域外的通用领域事实续接),并在优化目标领域SFT行为的同时,正则化适应模型以接近基础模型的软词元分布。 ## 初步研究 **参见标题** 图2:基础模型正确/SFT模型错误样本中的失败模式。大多数回忆失败是格式或冗余不匹配,而非干净的错误实体错误。 本节诊断领域SFT后的事实退化。闭卷生成准确率下降表明无法产生正确答案,但不代表相应事实被抹除。与近期关于虚假遗忘以及知识编码与回忆区别的研究一致(1 (https://arxiv.org/html/2608.20794#bib.bib17);7 (https://arxiv.org/html/2608.20794#bib.bib7);18 (https://arxiv.org/html/2608.20794#bib.bib6);47 (https://arxiv.org/html/2608.20794#bib.bib13)),表面退化可能反映任务对齐的转变而非底层能力的丧失。我们通过三个发现区分记忆擦除与表达失败。 ### F1:模型能识别它们无法回忆的内容 我们在基准级比较识别和回忆,因为领域SFT可能广泛降低事实行为或选择性损害事实引出。识别测试模型在约束评估下是否能选择正确答案,而回忆测试它是否能在没有候选集支持下生成答案。我们使用多项选择评估测量识别,使用闭卷QA指标EM/F1测量回忆(33 (https://arxiv.org/html/2608.20794#bib.bib18))。领域SFT提升了目标领域QA任务,但这一增益伴随着在留出的QA基准上开放式事实回忆的显著退化(见图1 (https://arxiv.org/html/2608.20794#Sx1.F1)b):例如,TriviaQA EM在完整基准上从65.03降至43.95,而MedMCQA和MMLU保持稳定或略有改善。此模式尚未构成同一事实分离,因为数据集在内容和格式上不同;相反,它为是否相同事实在约束评估下仍可访问的控制诊断提供了动力。 ### F2:事实被存储但不可访问 为分离引出格式与事实内容,我们在匹配事实上评估识别和回忆。我们将QA项目指向的事实关联表示为f=(s,r,o),其中s、r和o分别代表主体、关系和答案对象(30 (https://arxiv.org/html/2608.20794#bib.bib19);9 (https://arxiv.org/html/2608.20794#bib.bib12));这是分析性记法,而非声称TriviaQA项目构成显式知识图谱。对于每个项目,我们将原始开放式问题与相同答案对象的识别式探测配对。在此子集上,SFT显著降低了开放式生成(见图1 (https://arxiv.org/html/2608.20794#Sx1.F1)c):TriviaQA EM从63.1降至43.8,多项选择准确率边际变化,无排序退化。在教师强制下,黄金答案仍保持高排名:其第一个词元仍接近顶部,从Base到SFT,top-1率几乎不变。因此,在约束或教师强制评估下,不可靠生成的答案仍可被选择或高度偏好。 因此,我们将事实访问失败用作行为诊断:模型选择性地在开放式生成中无法产生某些事实,而非统一丧失事实行为。 ### F3:回忆失败主要是表达失败 配对探测显示识别和回忆可能分离,这促使我们分析生成文本中的这些回忆失败。我们分析了300个TriviaQA样本,其中基础模型EM正确但SFT模型EM错误。为区分事实错误与表面形式表达失败,我们将每个SFT输出标记为格式/冗余不匹配、错误实体、EM伪影(语义有效但被精确匹配拒绝)或非答案/拒绝。标签与独立LLM评判器(DeepSeek;见附录)在97.3%的情况下一致。如图2 (https://arxiv.org/html/2608.20794#Sx3.F2)所示,格式/冗余不匹配占主导,占分析样本的77.3%。这表明表达失败解释了大多数基础模型正确/SFT模型错误错误,尽管仍有不可忽视的子集对应真正的错误答案生成。作为分类器无关的引出检查,简单的4次提示恢复了90.0%的相同样本,表明此样本中许多失败在不同提示下仍可恢复,而非反映不可逆的知识抹除。 这些发现共同促使我们提出一种在领域SFT期间保留开放式事实表达的方法。 **参见标题** 图3:记忆锚定蒸馏概述
相似文章
中期训练中的知识蒸馏更倾向于推理而非事实回忆
本文介绍了Switch Distillation,这是一种新颖的中期训练目标,基于教师置信度选择性地应用知识蒸馏,以在较小的语言模型中改善推理并保留事实回忆。
RAFT:缓解遗忘的领域微调中的数据优化与自适应蒸馏
RAFT是一个两阶段框架,用于LLM的领域特定微调。它通过优化监督数据和使用带有自适应损失平衡的在线策略蒸馏来解决灾难性遗忘问题,在提升领域精度的同时恢复通用能力,取得了显著改进。
分布视角下的 SFT、RL 与 On-Policy Distillation(19 分钟阅读)
本文从分布视角分析语言模型的后训练方法,对比 SFT、RL 和 On-Policy Distillation 如何重塑模型分布,及其对灾难性遗忘等现象的影响。
自蒸馏作为大语言模型的性能恢复机制:对抗压缩和灾难性遗忘
本文介绍了自蒸馏微调(SDFT)作为大语言模型性能恢复机制,用于解决灾难性遗忘、量化和剪枝导致的性能下降问题。作者利用中心核对齐(CKA)提供了理论证明,表明自蒸馏能够使学生模型的高维流形与教师模型的最优结构对齐,从而有效恢复丧失的能力。
DataRx:面向更安全的大语言模型任务特定微调的缺失感知采样方法
本文提出了DataRx,一种缺失感知的采样方法,用于在任务特定微调期间选择安全关键的示例以保持大语言模型的安全性,在Llama3-8B-Instruct上将攻击成功率从59.23%降低到13.70%。