Inject, Align, Recover: 用于无检索文档知识内化的分阶段后训练

Hugging Face Daily Papers 论文

摘要

IAR 是一个三阶段后训练框架,将结构化文档知识内化到语言模型中,用于无检索问答,提升特定领域准确性和通用模型性能。

大型语言模型通常在推理时未检索源文档的情况下,无法回答关于有限文档集合的问题。我们将此设置研究为文档知识内化:将固定语料库转换为用于无检索问答的可用参数知识。我们提出了 IAR(Inject, Align, and Recover),一个三阶段后训练框架,它分离结构化文档知识注入、问答行为对齐和通用能力恢复。与传统的持续预训练不同,注入将源文档转换为续写、重写和指令条件重建目标。然后,对齐使用仅答案问答监督来调整注入模型,而恢复将领域适应模型与基础指令模型合并以恢复通用能力。在 Common Corpus (CC) 和 CCI 上,以及在 Llama、Phi、Qwen 和 SmolLM 模型家族中,IAR 改进了无检索文档内化的领域专用与领域通用前沿。在主要比较中,IAR 在 8 个数据集-模型设置中的 7 个中,在所有四个报告指标上优于 Vanilla SFT,领域问答准确率平均提高 3.6 个百分点,在 IFEval、MMLU 和 MSBench 上的平均通用性能提高 12.1 个百分点。扩展的 CC 基线显示,LoRA 和 FAPM 可以在单个通用指标上获胜,但在那些也达到领先或接近领先领域内化的方法中,IAR 保持了最强的通用轮廓之一。
查看原文
查看缓存全文

缓存时间: 2026/08/21 04:07

论文页面 - 注入、对齐、恢复:无需检索的文档知识内化的分阶段后训练方法

来源:https://huggingface.co/papers/2608.20281

摘要

IAR 是一个三阶段后训练框架,它将结构化文档知识注入语言模型,对齐模型以进行无需检索的问答,并恢复通用能力,从而同时提升领域准确性和整体性能。

大型语言模型在推理时若未检索源文档,往往无法回答有关限定文档集合的问题。我们将此设定研究为文档知识内化 (https://huggingface.co/papers?q=document%20knowledge%20internalization):将固定语料库转换为可用于无需检索问答 (https://huggingface.co/papers?q=retrieval-free%20question%20answering) 的参数化知识。我们提出 IAR (https://huggingface.co/papers?q=IAR)(注入、对齐与恢复)——一个将结构化文档知识注入 (https://huggingface.co/papers?q=structured%20document%20knowledge%20injection)、问答行为对齐 (https://huggingface.co/papers?q=QA%20behavior%20alignment) 和通用能力恢复 (https://huggingface.co/papers?q=general%20ability%20recovery) 分离的三阶段后训练框架。与传统的持续预训练不同,“注入”阶段将源文档转换为续写、改写和指令条件重构目标。随后“对齐”阶段使用仅答案的问答监督来适配注入后的模型,而“恢复”阶段则将领域适配模型与基础指令模型合并以恢复通用能力。在通用语料库(CC)和 CCI 上,以及在 Llama、Phi、Qwen 和 SmolLM 模型家族中,IAR (https://huggingface.co/papers?q=IAR) 在无需检索的文档内化任务中改进了领域-主要领域-通用边界。在主要对比中,IAR (https://huggingface.co/papers?q=IAR) 在 8 个数据集-模型设置中的 7 个里,相较于 Vanilla SFT 在所有四个报告指标上均有提升,在领域问答准确率上平均提升 3.6 个百分点,在 IFEval、MMLU 和 MSBench 的平均通用性能上平均提升 12.1 个百分点。扩展的 CC 基线表明,LoRA (https://huggingface.co/papers?q=LoRA) 和 FAPM (https://huggingface.co/papers?q=FAPM) 可能在个别通用指标上占优,但在同样达到领先或接近领先领域内化水平的方法中,IAR (https://huggingface.co/papers?q=IAR) 仍保持着最强的通用性能表现之一。

查看 arXiv 页面 (https://arxiv.org/abs/2608.20281)查看 PDF (https://arxiv.org/pdf/2608.20281)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.20281)

通过你的代理获取此论文:

hf papers read 2608\.20281

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型 0

没有模型链接到本文

在模型的 README.md 中引用 arxiv.org/abs/2608.20281 以从本页链接。

引用本文的数据集 0

没有数据集链接到本文

在数据集的 README.md 中引用 arxiv.org/abs/2608.20281 以从本页链接。

引用本文的 Spaces 0

没有 Space 链接到本文

在 Space 的 README.md 中引用 arxiv.org/abs/2608.20281 以从本页链接。

包含本文的合集 1

相似文章

理解环境感知信息检索的行为

Hugging Face Daily Papers

本文首次系统分析了大型语言模型如何通过强化学习学习适应不同检索器的查询制定策略,揭示了不同的最优查询风格,并引入了一种基于分支的展开技术以提高多检索步训练稳定性。