数据质量优于容量:将文档内化到LoRA适配器用于闭卷问答
摘要
本文研究了将文档内化到LoRA适配器用于闭卷问答,发现一旦适配器容量足够,训练数据质量(尤其是答案简洁性)成为主导因素,其效果超过架构更改,并比BM25-RAG实现更高的准确率。
arXiv:2607.21861v1 公告类型:新
摘要:我们研究通过LoRA将文档直接烘焙到4位Gemma-4-e4b模型的权重中,使系统能够回答关于语料库的闭卷问题:无需检索,无需上下文窗口预算。在从单个文档到99个文档语料库的大约100次训练运行中,我们发现一旦适配器容量足够,训练数据质量成为闭卷准确度的主导杠杆,其影响力超过LoRA秩、学习率以及两种替代架构的总和;容量本身是一道硬门槛,低于此门槛任何数据干预都无济于事。一次简单的筛选处理(将黄金答案缩短为规范的1-6个词跨度,并删除琐碎内容)使15个文档语料库上的闭卷准确度从57.7%提升到85.7%,比任何架构更改带来的提升都大。我们确认了一个容量趋势(秩必须随语料库大小增长),并且秩与学习率之间存在耦合,这一关系最初被我们误诊。在一个15个文档切片上,我们添加了一个真实检索基线:内化适配器(84.2%的召回率)超过了使用基础阅读器(58.9%)的BM25-RAG流水线,甚至超过了实际黄金块预言机(65.6%),且延迟更低。我们报告了整个弧线,包括三次误诊,作为调试LLM训练的实证案例研究。
查看缓存全文
缓存时间: 2026/07/27 07:39
# 数据质量胜于容量:将文档内部化为LoRA适配器用于闭卷问答 来源:https://arxiv.org/html/2607.21861 ## 数据质量胜于容量:将文档内部化为LoRA适配器用于闭卷问答 ###### 摘要 我们研究如何通过LoRA将文档直接烘焙到4-bit Gemma-4-e4b模型的权重中,使系统能够以*闭卷*方式回答关于语料库的问题:无需检索,也无需上下文窗口预算。在大约100次训练运行中(从单个文档到包含99个文档的语料库),我们发现一旦适配器容量足够,训练数据质量就成为了影响闭卷准确度的主要杠杆,其重要性超过了LoRA秩、学习率以及两种替代架构的总和;而容量本身是一个硬性门槛,低于该门槛时任何数据干预都无济于事。一次简单的数据整理(将标准答案缩短为规范的1–6个词跨度,并删除琐碎问题)将15个文档语料库的闭卷准确度从57.7%提升至85.7%,其提升幅度超过了任何架构变更。我们确认了一个容量趋势(秩必须随语料库大小增长),同时发现秩与学习率之间存在耦合关系(我们最初误判了这一点)。在15个文档切片上,我们添加了一个真实的检索基线:内部化适配器(84.2%召回率)在更低延迟下击败了使用基础阅读器的BM25-RAG流水线(58.9%),甚至击败了真实的金标块预言机(65.6%)。我们报告了完整的实验过程(包括三次误判),作为实证调试LLM训练的案例研究。 数据质量胜于容量:将文档内部化为LoRA适配器用于闭卷问答 Joan Figuerola Hurtado 独立研究员 ## 1 引言 检索增强生成(RAG)是语言模型利用其未训练过的语料库的默认方式:检索相关块并将其放入上下文。这限制了单次回答所能利用的语料库信息量,增加了检索作为失败模式的可能性,并消耗了每次查询的上下文预算。另一种方式是知识内部化:训练一个轻量级LoRA适配器(Hu等人,2021 (https://arxiv.org/html/2607.21861#bib.bib7))来以*闭卷*方式回答关于语料库的问题,提示中不包含文档文本。先前的工作权衡了微调与检索在注入新知识方面的优劣(Ovadia等人,2024 (https://arxiv.org/html/2607.21861#bib.bib9)),发现对新事实进行监督微调可能速度慢且容易产生幻觉(Gekhman等人,2024 (https://arxiv.org/html/2607.21861#bib.bib5)),而另一条研究线量化了模型参数能存储多少事实知识(Allen-Zhu and Li, 2024a (https://arxiv.org/html/2607.21861#bib.bib1))。我们的北极星目标是直接将文档集合内部化到模型权重中,使其内容无需检索步骤、不受固定上下文窗口限制即可被搜索和查询,即使集合增长到数万份文档也是如此。 我们报告了大约两个月的实验:什么方案能可靠地回答关于适配器在训练期间“阅读”过的文档的闭卷问题,以及它如何从1个文档扩展到99个文档。我们的结论并不光鲜,但我们认为具有普适性:一旦适配器拥有足够容量,最大的杠杆不是进一步提升容量或调整方案,而是训练QA数据的平凡质量——特别是标准答案的冗长程度。 贡献。(1) 一个实际例子:训练数据整理带来的提升(15个文档上+28个百分点)超过了架构变更(EntiGraph风格的合成预训练(Yang等人,2024 (https://arxiv.org/html/2607.21861#bib.bib10));可训练的KV缓存盒(Eyuboglu等人,2025 (https://arxiv.org/html/2607.21861#bib.bib4)))。(2) 一个语料库扩展阶梯,独立出“秩必须随语料库增长”的趋势,以及一个可迁移的经验教训(*更大的秩需要更温和的学习率*),该经验最初被误认为是容量瓶颈。(3) 一个真实的BM25-RAG基线,表明内部化在此任务和硬件上优于检索,并附有诚实的度量注意事项。所有数字均为单种子;我们将其与风格偏差的度量一起视为主要威胁(§4 (https://arxiv.org/html/2607.21861#S4))。 ## 2 任务、度量与方案 任务。对于一个文档语料库,我们生成闭卷问答对,其标准答案逐字源自原文。我们训练一个适配器来*不*在提示中包含原文的情况下回答问题。训练数据由强LLM自行生成,该LLM读取每篇文档自身提取的块(没有专用的QA教师模型);每个声明都附带逐字原文引用、8个训练改写问题以及2个保留问题。 度量。预测正确的条件是精确子串匹配(任一方向)或token-F1≥≥0.74。我们分别报告*召回率*(已知答案的问题)和*总体准确度*(还包括一个针对从未训练过的事实问题的弃权切片)。该度量在绝对意义上较为宽松,并且在结构上有利于短标准答案;我们将在§3 (https://arxiv.org/html/2607.21861#S3)和附录B (https://arxiv.org/html/2607.21861#A2)中直接测试这一点。 方案。基础模型:gemma-4-e4b-it-4bit,仅在全部42层的MLP投影上应用LoRA,通过MLX在Apple Silicon上训练。两个阶段合并为一个适配器:阶段A(类似CPT):对原始块加上多级改写进行完整损失训练(Maini等人,2024 (https://arxiv.org/html/2607.21861#bib.bib8));然后阶段B(SFT):闭卷QA监督,仅回答token损失。完整超参数和成本见附录A (https://arxiv.org/html/2607.21861#A1)。 ## 3 结果 上限与下限。在单个文档上,适度的LoRA(秩32,3000步)达到86–98%的闭卷总体准确度;两个文档时为94%。无上下文的基础模型得分约为∼0%。有趣的情况是多个文档。 数据质量是主导杠杆。在15个文档上,付费教师数据达到78.9%总体准确度(76.3%召回率)。改用自动生成的声明后,准确度急剧下降到57.7%(55.6%召回率)。消融实验排除了容量(秩32→→64:+3个百分点)、方案(单阶段*更差*)、事实质量和欠训练等因素。原因是数据的*可学习性*:自动生成模型无法拟合其自身数据,达到验证损失0.287(而教师数据为0.046);该流水线过度挖掘高熵琐事并将答案表述为长从句。重新整理(简明的标准答案、删除琐事、去重)将损失下限降至0.056,并将准确度提升至85.7%,仅凭数据就获得了+28个百分点的提升(表1 (https://arxiv.org/html/2607.21861#S3.T1)),超过了任何架构或容量干预,并在99个文档规模上得到了复现(见下文)。 由于整理缩短了答案,而我们的度量有利于短答案,我们通过更严格的规则重新评分了3,792个保存的预测,以检查这是否是评分伪影。结果表明并非如此:在精确匹配下,答案长度→→召回率梯度*扩大*(从+30到+47个百分点),因为宽松匹配给予长答案*更多*部分分(附录B (https://arxiv.org/html/2607.21861#A2))。剩余混杂因素(长答案本身更难生成)留待受控消融实验解决。 架构无法击败整理后的LoRA。在同一语料库上,EntiGraph风格的合成CPT增强(Yang等人,2024 (https://arxiv.org/html/2607.21861#bib.bib10))将总体准确度从84.0%降至82.1%,在单种子噪声范围内(匹配运行间约∼1.7个百分点)。从头实现的Cartridges(Eyuboglu等人,2025 (https://arxiv.org/html/2607.21861#bib.bib4))(可训练的KV缓存前缀)仅达到11.9%(交叉熵)和3.78%(带上下文蒸馏),且蒸馏变体的弃权率降至0%;我们报告此为*我们的实现未能具有竞争力*,而非架构定论。在此规模下,两者均未体现出其复杂性价值。 表1:数据整理是最大的单一杠杆(+28个百分点),超过任何架构变更。均为单种子;保留问题数量N=1,772–3,990。 容量必须随语料库大小扩展。在嵌套语料库上(CL-15⊂⊂CL-25⊂⊂CL-50⊂⊂CL-100),秩64的召回率从25个文档时的71%骤降至50个文档时的50%,伴随跨文档误绑定持平且损失下限上升,这是*容量饱和*(Allen-Zhu and Li, 2024b (https://arxiv.org/html/2607.21861#bib.bib2);Back等人,2026 (https://arxiv.org/html/2607.21861#bib.bib3))而非干扰的典型标志。将秩加倍至128可恢复性能(表2 (https://arxiv.org/html/2607.21861#S3.T2))。我们将其定位为趋势而非定律:它基于两次秩加倍,且关键在于阶梯中学习率固定,因此秩与学习率充分性仅部分分离。 更大的秩需要更温和的学习率。在CL-100上将秩再次加倍至256,沿用秩128的学习率,*倒退*了召回率(46.7% vs. 55.2%)。我们首先归咎于序列长度混杂;直接计数截断的token在几分钟内证伪了这一点(零个QA行被截断)。真正原因是未重新调优的学习率:将其减半(4e-5→→2e-5)降低了损失下限,并将召回率恢复至61.6%,以6个百分点的优势击败了秩128。两个看似合理但错误的诊断仅通过直接测量才与真实原因区分开来。 表2:秩必须随语料库大小增长(r64在25–50个文档时饱和);并且更大的秩需要更温和的学习率(r256的倒退是学习率伪影,而非容量问题)。单种子;语料库召回率。 闭环验证。在CL-100上,较旧的文档批次落后于较新的批次;唯一测量到的差异是标准答案长度(7.5个词 vs. 4.1个词),这是由于答案简洁规则在构建过程中才被指定。按当前规范重新编写较旧的51个文档,将总体召回率从61.6%提升至68.4%,所有批次趋于一致,并在约∼7×倍原始语料库规模上复现了数据质量的发现。 真实检索基线。我们的动机是内部化替代检索,但之前的一个“预言机RAG”数字(约∼100%)实际上是强制注入标准答案并直接复制,是一个平凡的而非检索的上界。我们基于15个文档语料库构建了一个真正的基线,在相同的2,009个问题和评分器上进行评估:一个BM25检索器(基于原始块)输入一个*基础*阅读器(无适配器),加上一个真实的预言机,将真实金标杆喂给该阅读器(表3 (https://arxiv.org/html/2607.21861#S3.T3))。内部化适配器(84.2%召回率)以更低延迟击败了BM25-RAG约∼25个百分点,甚至击败了真实预言机约∼19个百分点。BM25在秩1时仅53%的概率将金标杆置于首位(秩5时为86%),且即使金标杆存在,基础阅读器也只能达到65.6%:检索和阅读都存在损失。 表3:15个文档语料库上的真实检索基线(N=2,009;相同确定性评分器)。内部化在准确度和延迟上均击败BM25-RAG和真实金标杆预言机。注意:度量有利于风格匹配的适配器,因此RAG的准确度是其知识的下限(§4 (https://arxiv.org/html/2607.21861#S4))。 ## 4 讨论与效度威胁 统一发现。(1) 容量是门槛;一旦足够,数据质量主导,两者互补而非竞争。(2) 秩必须随语料库大小增长(在两次加倍中,文档数约∼2×倍时秩约∼2×倍)。(3) 更大的秩需要更温和的学习率;未重新调优会模仿容量倒退。(4) 干扰(误绑定增加、损失下限稳定)与容量饱和(均匀下降、下限上升)具有可区分的特征,从而指导正确的修复措施。(5) 两种架构替代方案在此规模下未能击败我们手中的整理LoRA。 威胁。*单种子*:每次运行均使用种子42;2个百分点以下的差异在观测噪声范围内,关键差异需要多种子复现,我们尚未进行。*度量有利于适配器*:确定性评分器奖励风格匹配的适配器,而惩罚改写的RAG基础阅读器,因此RAG的准确度是其知识的下限;读者无关的BM25命中率(在k=5时为86%)部分控制了这一点,LLM评判重新评分是公平的后续工作。*规模*:99个文档远低于数万文档的目标,因此负面的架构结果以及精确的秩/学习率常数可能无法外推;特别是更大规模的Cartridge训练报告了我们的较小规模运行无法获得的增益(Eyuboglu等人,2025 (https://arxiv.org/html/2607.21861#bib.bib4);Hardalov等人,2026 (https://arxiv.org/html/2607.21861#bib.bib6))。*单一模型/硬件与4-bit基础*:量化可能部分造成了我们归因于数据的损失下限;需要更高精度的控制实验。 ## 5 结论 在约∼100次运行中,最强烈且可复现的发现是:在容量足够的前提下,训练数据质量(特别是答案简洁性和删除琐事)对于闭卷内部化是一个更大且更可靠的杠杆,超过了容量、学习率调优或我们测试的替代架构。内部化在此规模上也在准确度和延迟上击败了真实的BM25-RAG基线以及真实预言机,但存在有利于微调阅读器的度量偏差。未来工作:多种子方差、在完整语料库规模上使用LLM评判进行RAG比较,以及路由多个较小适配器以实现数万文档目标。 ## 参考文献 - Allen-Zhu and Li (2024a) Zeyuan Allen-Zhu and Yuanzhi Li. 2024a. Physics of language models: Part 3.1, knowledge storage and extraction (https://arxiv.org/abs/2309.14316). *arXiv preprint arXiv:2309.14316*. ICML 2024. - Allen-Zhu and Li (2024b) Zeyuan Allen-Zhu and Yuanzhi Li. 2024b. Physics of language models: Part 3.3, knowledge capacity scaling laws (https://arxiv.org/abs/2404.05405). *arXiv preprint arXiv:2404.05405*. - Back et al. (2026) Seungwoo Back et al. 2026. Understanding LoRA as knowledge memory: An empirical analysis (https://arxiv.org/abs/2603.01097). *arXiv preprint arXiv:2603.01097*. ICML 2026. - Eyuboglu et al. (2025) Sabri Eyuboglu et al. 2025. Cartridges: Lightweight and general-purpose long context representations via self-study (https://arxiv.org/abs/2506.06266). *arXiv preprint arXiv:2506.06266*. - Gekhman et al. (2024) Zorik Gekhman, Gal Yona, Roee Aharoni, Matan Eyal, Amir Feder, Roi Reichart, and Jonathan Herzig. 2024. Does fine-tuning LLMs on new knowledge encourage hallucinations? (https://arxiv.org/abs/2405.05904) In *Proceedings of EMNLP*. - Hardalov et al. (2026) Momchil Hardalov, Gonzalo Iglesias, and Adrià de Gispert. 2026. Cartridges at scale: Training modular KV caches over large document collections (https://arxiv.org/abs/2606.04557). *arXiv preprint arXiv:2606.04557*. - Hu et al. (2021) Edward J. Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen. 2021. LoRA: Low-rank adaptation of large language models (https://arxiv.org/abs/2106.09685). *arXiv preprint arXiv:2106.09685*. - Maini et al. (2024) Pratyush Maini, Skyler Seto, He Bai, David Grangier, Yizhe Zhang, and Navdeep Jaitly. 2024. Rephrasing the web: A recipe for compute and data-efficient language modeling (https://arxiv.org/abs/2401.16380). *arXiv preprint arXiv:2401.16380*. - Ovadia et al. (2024) Oded Ovadia, Menachem Brief, Moshik Mishaeli, and Oren Elisha. 2024. Fine-tuning or retrieval? comparing knowledge injection in LLMs (https://arxiv.org/abs/2312.05934). *arXiv preprint arXiv:2312.05934*. - Yang et al. (2024) Zitong Yang, Neil Band, Shuangping Li, Emmanuel Candès, and Tatsunori Hashimoto. 2024. Synthetic continued pretraining (https://arxiv.org/abs/2409.07431). *arXiv preprint arXiv:2409.07431*.
相似文章
从KV缓存压缩的角度重新思考LoRA内存
本文研究了文档级问答中参数侧内存(LoRA适配器)与上下文侧内存(KV缓存)之间的交互。研究发现,当KV缓存被大幅压缩时,文档LoRA变得最有价值,可恢复13–21个ROUGE-L点,并且经过问答监督的适配器优于基于下一词预测的适配器。
在abliterated Qwen 3.8-27B上进行LoRA训练以实现内部代码库召回[P]
在一个abliterated Qwen 3.8-27B模型上训练了LoRA适配器,以增强内部代码库召回,在评估中展示了在针对私有仓库的任务上优于Claude模型的性能。
PermDoRA——理解语言模型中的适配器干扰:参数空间几何的局限性
本文介绍了DoRA-RBAC,一个用于组合LLM适配器的框架,并测试了几何感知合并是否能提升多域性能。结果显示,与标准平均方法相比,没有一致的改进,表明适配器干扰并非主要由参数空间几何驱动。
当大语言模型过度回答:测量与缓解基于LLM的硬件描述语言问答中的质量问题
本文研究了LLM生成的硬件描述语言问答中的质量问题,发现过度回答倾向,如冗余(65.7%)和冗长(69.1%),并提出了一种多智能体框架,将核心答案减少37%,非核心内容长度减少31%,同时提高质量分数。
Code2LoRA:超网络生成的适配器,用于软件演进中的代码语言模型
Code2LoRA 引入了一个超网络,该超网络能够从代码仓库中一次性前向传播生成 LoRA 适配器,使得冻结的代码大语言模型无需额外 token 即可适应仓库上下文,并高效支持不断演进的代码库。此外,它还提供了 RepoPeftBench,一个用于仓库条件代码建模的基准测试。