Inject, Align, Recover: 用于无检索文档知识内化的分阶段后训练
摘要
IAR 是一个三阶段后训练框架,将结构化文档知识内化到语言模型中,用于无检索问答,提升特定领域准确性和通用模型性能。
查看缓存全文
缓存时间: 2026/08/21 04:07
论文页面 - 注入、对齐、恢复:无需检索的文档知识内化的分阶段后训练方法
来源:https://huggingface.co/papers/2608.20281
摘要
IAR 是一个三阶段后训练框架,它将结构化文档知识注入语言模型,对齐模型以进行无需检索的问答,并恢复通用能力,从而同时提升领域准确性和整体性能。
大型语言模型在推理时若未检索源文档,往往无法回答有关限定文档集合的问题。我们将此设定研究为文档知识内化 (https://huggingface.co/papers?q=document%20knowledge%20internalization):将固定语料库转换为可用于无需检索问答 (https://huggingface.co/papers?q=retrieval-free%20question%20answering) 的参数化知识。我们提出 IAR (https://huggingface.co/papers?q=IAR)(注入、对齐与恢复)——一个将结构化文档知识注入 (https://huggingface.co/papers?q=structured%20document%20knowledge%20injection)、问答行为对齐 (https://huggingface.co/papers?q=QA%20behavior%20alignment) 和通用能力恢复 (https://huggingface.co/papers?q=general%20ability%20recovery) 分离的三阶段后训练框架。与传统的持续预训练不同,“注入”阶段将源文档转换为续写、改写和指令条件重构目标。随后“对齐”阶段使用仅答案的问答监督来适配注入后的模型,而“恢复”阶段则将领域适配模型与基础指令模型合并以恢复通用能力。在通用语料库(CC)和 CCI 上,以及在 Llama、Phi、Qwen 和 SmolLM 模型家族中,IAR (https://huggingface.co/papers?q=IAR) 在无需检索的文档内化任务中改进了领域-主要领域-通用边界。在主要对比中,IAR (https://huggingface.co/papers?q=IAR) 在 8 个数据集-模型设置中的 7 个里,相较于 Vanilla SFT 在所有四个报告指标上均有提升,在领域问答准确率上平均提升 3.6 个百分点,在 IFEval、MMLU 和 MSBench 的平均通用性能上平均提升 12.1 个百分点。扩展的 CC 基线表明,LoRA (https://huggingface.co/papers?q=LoRA) 和 FAPM (https://huggingface.co/papers?q=FAPM) 可能在个别通用指标上占优,但在同样达到领先或接近领先领域内化水平的方法中,IAR (https://huggingface.co/papers?q=IAR) 仍保持着最强的通用性能表现之一。
查看 arXiv 页面 (https://arxiv.org/abs/2608.20281)查看 PDF (https://arxiv.org/pdf/2608.20281)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.20281)
通过你的代理获取此论文:
hf papers read 2608\.20281
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型 0
没有模型链接到本文
在模型的 README.md 中引用 arxiv.org/abs/2608.20281 以从本页链接。
引用本文的数据集 0
没有数据集链接到本文
在数据集的 README.md 中引用 arxiv.org/abs/2608.20281 以从本页链接。
引用本文的 Spaces 0
没有 Space 链接到本文
在 Space 的 README.md 中引用 arxiv.org/abs/2608.20281 以从本页链接。
包含本文的合集 1
相似文章
利用外部知识通过检索增强型大语言模型进行历史文档修复
本文介绍了ARI,一个利用检索增强型大语言模型修复历史文档中难以辨认部分的框架,通过将隐式的大语言模型知识与显式检索的外部历史背景相结合,显著提升了命名实体的修复效果。
HIRA: 用于受监管行业文档分类的人机协同检索增强级联系统
HIRA 是一种免训练、本地部署的检索增强级联系统,用于受监管行业的文档分类。它利用人工反馈和本地部署的大语言模型(LLM)来提高准确性,同时减少模型重新训练和 LLM 调用次数。
Hybrid-IR:面向复杂医学问答的双路径混合检索与迭代推理
Hybrid-IR 提出了一种双路径检索框架,结合基于图的检索和稠密检索,并采用迭代推理来改进复杂医学问答,克服了现有RAG方法的局限性。在三个基准上的实验表明了其有效性。
理解环境感知信息检索的行为
本文首次系统分析了大型语言模型如何通过强化学习学习适应不同检索器的查询制定策略,揭示了不同的最优查询风格,并引入了一种基于分支的展开技术以提高多检索步训练稳定性。
STAIR(结构感知信息检索器):一种新颖的基于数据集和LLM的检索器,用于文档结构增强
STAIR引入了一种结构感知检索系统,利用目录增强大语言模型的文档检索,在新的SearchTome基准数据集上实现了高性能。