使用QLoRA学习新事实:获取-保留前沿

arXiv cs.CL 论文

摘要

本文探讨了在语言模型中使用QLoRA时,事实知识获取与能力保留之间的权衡,表明更高秩的QLoRA改善了事实学习,但可能降低域外性能。

arXiv:2608.25677v1 Announce Type: new Abstract: 参数高效微调通常被认为可以保留预训练能力,因为它只更新少量参数。我们表明,这一假设强烈依赖于适配器容量。我们在一个受控的OpenStreetMap衍生基准测试中研究事实获取,其中Qwen3-4B必须获取匿名化的地理关联,同时保留不相关的能力。比较全微调(FFT)与秩为8、16、32和64的量化低秩适应(QLoRA),我们发现秩诱导了一个清晰的获取-保留前沿。低秩QLoRA保留了域外(OOD)性能,但获取的事实较少,而更高的秩改善了相同事实改写泛化,但以不相关基准测试上的性能下降为代价。FFT作为保守基线:它很好地保留了通用能力,但未达到最高的事实获取状态。分布、权重空间和频谱诊断反映了这种行为权衡,更高秩的QLoRA远离了预训练模型。一个单独的数学适应实验显示了一个较弱的前沿,这表明当适应必须安装新的事实关联,而不是强化预训练已支持的技能时,效果最为显著。代码和数据可在https://github.com/zhngstl/new_facts_forgetting获取。
查看原文
查看缓存全文

缓存时间: 2026/08/27 09:25

# 使用 QLoRA 学习新事实:习得-保留边界
来源:https://arxiv.org/html/2608.25677  
Estelle Zheng  
机构:LORIA,CNRS,法国  
机构:Alcatel\-Lucent Enterprise,法国  
邮箱:[estelle\.zheng@loria\.fr](mailto:)  
Emmanuel Helbert  
机构:Alcatel\-Lucent Enterprise,法国  
Christophe Cerisara  
机构:LORIA,CNRS,法国  

###### 摘要  
参数高效微调通常被认为能保留预训练能力,因为它只更新少量参数。我们表明,这一假设强烈依赖于适配器容量。我们在一个受控的基于 OpenStreetMap 的基准测试中研究事实习得,其中 Qwen3\-4B 模型必须在保留无关能力的同时,习得匿名的地理关联。比较全量微调(FFT)与秩为 8、16、32 和 64 的量化低秩适应(QLoRA),我们发现秩诱导了一个清晰的习得-保留边界。低秩 QLoRA 保留了分布外(OOD)性能,但习得的事实较少;而更高的秩在提升同事实释义泛化能力的同时,以无关基准测试上的性能下降为代价。FFT 表现为一个保守的基线:它较好地保留了一般能力,但未能达到最高事实习得区间。分布、权重空间和谱诊断反映了这种行为上的权衡,更高秩的 QLoRA 与预训练模型的距离更远。一个独立的数学适应实验表明这种边界效应较弱,这表明当适应需要安装新的事实关联,而非强化预训练已支持的技能时,这种效应最为显著。代码和数据可在 https://github.com/zhngstl/new_facts_forgetting 获取。

## 1 引言  
预训练语言模型(PLMs)通常需要针对新领域、特定任务技能或事实知识进行微调。全量微调(FFT)更新所有模型参数,可以是有效的,但成本高昂,并且可能在适应分布外降低性能。参数高效微调(PEFT)方法,如低秩适应(LoRA)及其量化变体 QLoRA,通过冻结预训练权重并学习低秩更新来降低这种成本(Hu et al., 2022 (https://arxiv.org/html/2608.25677#bib.bib17); Dettmers et al., 2023 (https://arxiv.org/html/2608.25677#bib.bib18))。这种限制通常被认为能提高先前能力的保留,但它也可能限制模型能够习得的内容。最近的研究表明,LoRA 和 FFT 之间的关系不仅仅是效率问题。Biderman et al. \(2024\) (https://arxiv.org/html/2608.25677#bib.bib15) 发现 LoRA 可以保留更多的分布外(OOD)行为,部分原因是它从目标分布中学到的东西较少。Shuttleworth et al. \(2025\) (https://arxiv.org/html/2608.25677#bib.bib16) 表明 LoRA 和 FFT 可以从权重空间的不同区域达到相似的准确率。其他比较研究了广泛的适应设置,如编码(Männistö et al., 2025 (https://arxiv.org/html/2608.25677#bib.bib28))、数学(Biderman et al., 2024 (https://arxiv.org/html/2608.25677#bib.bib15))、问答(Sun et al., 2023 (https://arxiv.org/html/2608.25677#bib.bib27))或指令微调(Xin et al., 2024 (https://arxiv.org/html/2608.25677#bib.bib26))。这些设置混合了多种增益:格式适应、技能强化、领域迁移或新信息。我们接下来将重点放在事实知识习得上。在此背景下,除非同时衡量习得情况,否则保留是模糊的:低容量适配器可能显得更安全,仅仅因为它没有强烈地整合目标事实。我们的设置与事实知识编辑相关,后者修改特定关联同时保留无关行为(Meng et al., 2022 (https://arxiv.org/html/2608.25677#bib.bib19); Mitchell et al., 2022 (https://arxiv.org/html/2608.25677#bib.bib20); Meng et al., 2023 (https://arxiv.org/html/2608.25677#bib.bib22); Yang et al., 2025b (https://arxiv.org/html/2608.25677#bib.bib21)),以及持续学习,后者研究顺序更新下的稳定性-可塑性权衡(Jang et al., 2022 (https://arxiv.org/html/2608.25677#bib.bib32); Shi et al., 2025 (https://arxiv.org/html/2608.25677#bib.bib33))。然而,模型编辑基准测试通常侧重于对已知事实的局部修改,有时是替换现有关联;而持续学习方法通常评估一系列任务或更新,包括基于 PEFT 的方法,这些方法通过正则化、初始化或合并适配器子空间(Lu et al., 2025 (https://arxiv.org/html/2608.25677#bib.bib31); Qiao and Mahdavi, 2026 (https://arxiv.org/html/2608.25677#bib.bib1))。我们的目标不同:我们研究一个受控的单批次适应阶段,其中模型使用标准的 FFT 和 QLoRA 习得新的事实关联。我们衡量适应容量如何影响习得、释义泛化以及一般 LLM 能力的保留。我们引入了一个源自 OpenStreetMap(OSM)的事实习得基准,训练模型习得匿名的地理关联。匿名实体减少了对预训练世界知识的直接依赖,而 OSM 结构保留了现实的关联依赖性。我们将 FFT 与秩 \(r\in\{8,16,32,64\}\) \(r\\in\\\{8,16,32,64\\\}\) 的 QLoRA 进行比较,并评估有监督的事实记忆、同事实释义泛化和 OOD 保留。我们进一步将行为性能与模型漂移诊断联系起来,包括与基础模型的 KL 散度、RMS 归一化的密集更新范数以及基于 SVD 的谱变化。在 Qwen3\-1\.7B 上进行的标准化 LoRA 秩扫描单独测试了在没有量化的情况下,这种秩趋势是否仍然存在。我们的结果显示,LoRA 秩诱导了一个清晰的习得-保留边界。低秩 LoRA 保留了 OOD 性能,但习得的事实较少,而更高秩的 LoRA 以更大的 OOD 退化为代价提高了事实习得。FFT 表现为一个基线:它相对较好地保留了一般能力,但没有达到更高秩 LoRA 所观察到的最高事实习得区间。同样的趋势出现在模型漂移诊断中,更高习得的 LoRA 运行结果离预训练模型更远。本文做出三项贡献:(i) 我们引入了一个受控的基于 OpenStreetMap 的事实习得基准,使用匿名实体以减少对预训练世界知识的直接依赖;(ii) 我们表明 QLoRA 秩控制了新事实关联的习得-保留边界;(iii) 我们将这种行为权衡与模型漂移诊断联系起来,表明更强的事实习得与来自预训练模型更大的分布和权重空间偏移相关联。

## 2 方法论  
标准的微调数据集通常评估广泛的任务适应,而非真正新事实的习得。常用于评估知识编辑的基准测试,如 ZsRE(Levy et al. \(2017\) (https://arxiv.org/html/2608.25677#bib.bib30))、CounterFact(Meng et al. \(2022\) (https://arxiv.org/html/2608.25677#bib.bib19))、MQuAKE(Zhong et al. \(2023\) (https://arxiv.org/html/2608.25677#bib.bib23))和 RippleEdits(Cohen et al. \(2024\) (https://arxiv.org/html/2608.25677#bib.bib24))通常评估对已知事实的局部更新,包括反事实或过时的关联。它们与我们的目标——研究在一批新的匿名关联上的标准适应——是互补的。完全合成的基准也可以提供新事实,但其拓扑结构、关系频率和跨关系依赖性必须由研究者选择。我们转而使用 OpenStreetMap(OSM),因为它提供了一个自然发生的、内部一致的图结构,其结构独立于我们的实验假设生成。然后通过匿名化减少对预训练词汇知识的依赖,同时保留这种非均匀的关系结构。

### 2\.1 OSM 事实习得数据集  
我们从 14 个市级 OSM 提取中派生出原子事实,将实体(POI、道路和城市)与五种关系类型关联:POI 类别、所属城市、最近道路、最近 POI 和道路长度区间。训练集包含 1,938 个指令风格的问答示例,涵盖直接查询、释义、局部性保持探测、空间组合问题和反向城市签名示例。评估使用 900 个保留示例,这些示例源自相同的事实,但使用不相交的表面模板表达,因此性能衡量的是事实关联的习得及其跨表面形式的泛化,而非提示记忆。由于某些关系具有不同的答案类型,基准测试本身并不能确立模型学习了抽象的关系语义。为了减少来自预训练世界知识的污染,我们将源城市限制为小城市,并将所有实体名称替换为合成标识符(例如,C\-TRAIN\-001,POI\-TRAIN\-000001)。数据集详情见附录 A (https://arxiv.org/html/2608.25677#A1),示例提示见附录 D (https://arxiv.org/html/2608.25677#A4)。

### 2\.2 基础模型先验知识诊断  
在微调之前,我们测试基础模型是否已经能够从先验知识或答案类型偏差中解决该任务。我们评估了数据的匿名化和非匿名化版本作为问答任务,模型被提示生成标准答案。我们报告精确匹配(EM)生成准确率和一个教师强制的标准答案与干扰项偏好分数。对于每个示例,我们从同一划分中的其他标准答案中采样五个干扰项,尽可能匹配答案类型和关系。当模型的每个 token 平均对数概率超过干扰项时,它倾向于选择标准答案。我们报告标准答案偏好对的百分比和平均对数概率差(Δ\(\Delta\)lp)。更多细节见附录 C (https://arxiv.org/html/2608.25677#A3)。  
表 1:基础模型先验诊断。匿名化降低了 EM 准确率、标准答案偏好和对数概率差,表明真实名称激活了相关的预训练信息。较高的释义 EM 部分反映了其约束响应问题比例更大;见附录 A\.1 (https://arxiv.org/html/2608.25677#A1.SS1)。  
表 1 (https://arxiv.org/html/2608.25677#S2.T1) 表明真实实体名称提供了有用的语义线索,而匿名化显著降低了精确匹配和答案似然差。偏好分数略高于随机水平,表明存在微弱的结构或答案类型偏差,但基础模型无法直接解决匿名任务。释义划分上较高的 EM 部分是响应格式效应。释义划分中是非题的比例大约是其两倍,使其近似随机 EM 从 6\.68% 增加到 10\.36%。附录 A\.1 (https://arxiv.org/html/2608.25677#A1.SS1) 给出了完整的计数和比例。

## 3 实验设置  

### 3\.1 模型与适应方法  
我们使用 Qwen3\-4B(Yang et al., 2025a (https://arxiv.org/html/2608.25677#bib.bib2))作为基础模型,并比较全量微调(FFT)与秩 \(r\in\{8,16,32,64\}\) \(r\\in\\\{8,16,32,64\\\}\) 的 QLoRA 适配器。每个训练样本包含一个问题及其标准答案,自回归损失仅应用于答案 token。所有运行都在五个随机种子上重复。超参数在附录 E (https://arxiv.org/html/2608.25677#A5) 中报告。为了测试适配器内部的秩趋势在没有量化的情况下是否持续存在,我们还在 Qwen3\-1\.7B(Yang et al., 2025a (https://arxiv.org/html/2608.25677#bib.bib2))上运行了秩 \(r\in\{8,16,32\}\) \(r\\in\\\{8,16,32\\\}\) 的标准 LoRA,使用相同的 OSM 任务和 OOD 评估套件。这个缩减的对照改变了模型规模;但在其秩扫描范围内。

### 3\.2 评估轴  
我们从三个轴评估每个适应后的模型。

#### 事实习得  
我们在两个 OSM 划分上报告 EM 准确率。训练准确率衡量对有监督事实的恢复,而释义准确率衡量在与训练不相交的保留模板下对同一事实的泛化。因为释义集派生自训练事实,它测试的不是未见的 OSM 知识;而是测试学习到的关联是否对措辞变化具有鲁棒性。

#### OOD 保留  
我们使用 LM Evaluation Harness(Gao et al., 2024 (https://arxiv.org/html/2608.25677#bib.bib3))评估五个基准测试:HumanEval(Chen et al., 2021 (https://arxiv.org/html/2608.25677#bib.bib4))、IFEval(Zhou et al., 2023 (https://arxiv.org/html/2608.25677#bib.bib5))、TruthfulQA(Lin et al., 2022 (https://arxiv.org/html/2608.25677#bib.bib6))、MMLU\-Redux\-2\.0(Gema et al., 2025 (https://arxiv.org/html/2608.25677#bib.bib7))和 BBH(Suzgun et al., 2023 (https://arxiv.org/html/2608.25677#bib.bib8))。这些涵盖了代码生成、指令遵循、真实性、常识知识和推理。我们将遗忘定义为相对于基础模型的平均 OOD 分数下降:\(\Delta_{\mathrm{OOD}}=\mathrm{OOD}_{\mathrm{base}}-\mathrm{OOD}_{\mathrm{adapted}}\)。\(\Delta\_\{\mathrm\{OOD\}\}=\mathrm\{OOD\}\_\{\mathrm\{base\}\}\-\mathrm\{OOD\}\_\{\mathrm\{adapted\}\}\)。

#### 模型漂移诊断  
仅凭行为准确率无法揭示习得是如何实现的:两个模型可能达到相似的 OSM 准确率,但在偏离预训练模型的程度上存在显著差异,这对保留有不同的影响。遵循先前关于 LoRA 保留和 LoRA–FFT 权重空间差异的工作(Biderman et al., 2024 (https://arxiv.org/html/2608.25677#bib.bib15); Shuttleworth et al., 2025 (https://arxiv.org/html/2608.25677#bib.bib16)),因此我们使用与基础模型的 KL 散度(Shenfeld et al., 2026 (https://arxiv.org/html/2608.25677#bib.bib25))、对标准 OSM 答案的教师强制负对数似然、RMS 归一化的密集权重漂移以及基于 SVD 的入侵维度(Glorot and Bengio, 2010 (https://arxiv.org/html/2608.25677#bib.bib29); Shuttleworth et al., 2025 (https://arxiv.org/html/2608.25677#bib.bib16))来衡量漂移。为了可比性,FFT 和 QLoRA 在相同的密集更新空间中分析:FFT 的 \(W_{\mathrm{ft}}-W_0\) \(W\_\{\mathrm\{ft\}\}\-W\_\{0\}\) 和 QLoRA 的 \(\Delta W=\frac{\alpha}{r}BA\) \(\Delta W=\\frac\{\\alpha\}\{r\}BA\)。RMS 归一化控制了不同模块大小的影响。完整指标定义见附录 C (https://arxiv.org/html/2608.25677#A3)。

图 1:OSM 释义准确率与平均 OOD 性能对比。点显示最终检查点的均值,误差条显示在五个种子上的标准差。更高秩的 QLoRA 达到更强的习得但更低的保留,而 FFT 和秩 8 仍更接近预训练模型。

## 4 结果  
图 2:不同 QLoRA 秩的模型漂移诊断。\((a)\) 更高秩的 QLoRA 适配器显示出与预训练模型更大的 KL 散度,\((b)\) 更大的有效权重更新,以及 \((c)\) 在 SVD 入侵诊断下更大的谱偏移。虚线显示 FFT 以供比较。点显示均值,误差条显示在五个种子上的标准差。

### 4\.1 QLoRA 秩控制习得-保留权衡  
图 1 (https://arxiv.org/html/2608.25677#S3.F1) 显示 QLoRA 秩作为可塑性控制器。低秩使模型接近预训练解,因此保留 OOD 行为,但这种保留与较弱的同事实泛化相关联。增加秩允许模型更可靠地安装 OSM 关联,但将其移动到边界的更低保留部分。秩 64 处于高可塑性、低保留区间:事实准确率保持很高,但无关能力开始下降。

相似文章

语言模型能否在其权重中持续学习事实?

arXiv cs.CL

本文研究了语言模型能否通过持续学习在其权重中学习新事实。通过使用虚构事实并顺序写入Qwen3模型,研究发现训练数据的广度决定了知识类型和保留程度:单纯陈述的事实会迅速被遗忘(20次写入后准确率仅1%),而从多样化复述中学习的事实保留了46%的准确率。被遗忘的事实并未被擦除,而是由于后续写入重定向了问题而变得行为上不可访问,上下文仍然是事实组合和存续的可靠渠道。

持续学习机制组合以实现长期记忆

Hugging Face Daily Papers

本文表明,结合互补的持续学习机制可以增强语言模型中的长期记忆,通过数据、功能和权重锚点以及合并的LoRA,将保留率提升28倍。

超越推理:强化学习释放大型语言模型中的参数化知识

arXiv cs.CL

本文探讨了强化学习能否在推理任务之外,进一步提升大型语言模型(LLM)对参数化知识的直接回忆能力。研究表明,通过二元奖励进行强化学习,可以通过重新分配概率质量来激活潜在知识,而非习得新事实,从而在事实性问答基准测试中取得显著提升。