训练知识库:代理管理的文档存储的监督结构学习

arXiv cs.CL 论文

摘要

本文提出了一种监督结构学习方法,用于训练代理管理的知识库,将存储视为模型,以提高检索准确率并减少检索增强生成系统中的动作使用。

arXiv:2608.21829v1 公告类型:新 摘要:检索增强生成将文档存储视为冻结输入,而那些让代理策划存储的系统从未衡量策划对存储的影响。我们反转了这一框架:知识库是模型。训练代理针对当前存储回答监督问题,看到正确答案后编辑存储;之后,在固定动作预算下,未更改的读者在冻结快照上被测试。离线图构建是无监督的,而(问题,答案)对是我们的标签——正是这种监督使得结构成本低廉。每索引一点语料库,它返回的节省动作为无监督实体索引的1.6倍,准确率为1.8倍,后者覆盖所有内容,使用1,913个链接对比其196,112个。在存储训练过的问题上,未更改的读者以更高准确率减少了31%的动作,并且结果在官方PhantomWiki生成上重现,其中问题非我们所写。为衡量这延伸多远,我们引入关键覆盖度梯度,一个探测变化问题中训练集触及多少的方法,用衰减曲线取代训练/测试分割的通过/失败。泛化被证明依赖于端点:准确率传递到未见过的问题(当问题的两个关键都被索引时F1增加0.167,当一个被索引时增加0.100,当没有时为零),而节省动作仅限于训练过的问题。因为衰减是基于覆盖度而非新颖性索引的,更多训练可以扩展它——并且存储是欠训练的,而非饱和的:覆盖度在新问题上线性增长,并在训练重复问题时立即停止,因此一百个问题达到语料库的四分之一,四倍的问题会缩小差距。
查看原文
查看缓存全文

缓存时间: 2026/08/25 04:18

# 训练知识库:面向智能体策展文档库的监督结构学习
来源:https://arxiv.org/html/2608.21829  
Hongfeng Yu  机构:内布拉斯加大学林肯分校  [email protected]

###### 摘要

检索增强生成将文档库视为静态输入,而那些允许智能体策展文档库的系统从未评估策展会对库本身产生何种影响。我们反转了这一框架:*知识库即模型*。训练智能体基于当前库回答监督问题,展示标准答案后编辑库;随后不变的阅读器在固定操作预算下对冻结快照进行检验。相较于无监督的离线图构建,(问题, 答案)对即为标签——正是这种监督使结构构建更高效。按语料库中每个索引点计算,该方法在操作节省量上达到覆盖全量的无监督实体索引的1.6倍,在准确率上达到其1.8倍,仅用1,913条链接对比其196,112条链接。对于库训练过的问题,不变阅读器能以更高准确率减少31%的操作量,该结果在未参与问题编写的官方PhantomWiki生成集上得到复现。为衡量泛化范围,我们引入*键覆盖梯度*——一种通过变化训练集对问题关键信息的覆盖比例进行探测的方法,将训练/测试划分的通过/失败替换为衰减曲线。泛化性证明依赖端点:当问题的两个键均被索引时,对未见问题的F1提升+0.167;当一个键被索引时为+0.100;均未索引时则为零——而操作节省仅存在于训练过的问题上。由于该衰减按覆盖度而非新颖性索引,增加训练可延续效果:库尚未饱和,覆盖度随新问题线性增长,在训练重复问题时立即停止,因此一百个问题覆盖四分之一语料库,而问题数量增至四倍可填补差距。

###### 索引术语:

知识库、大语言模型智能体、检索增强生成、智能体式RAG、记忆、基准测试

## I 引言

赋予语言模型持久知识的主流方式是检索增强生成(RAG):一次性嵌入语料库,查询时检索,永不回写。一条迅速发展的研究线打破了这种不对称性。智能体维护的维基将来源编译为演化中的页面网络[1,2,3];智能体记忆系统在会话间累积并链接笔记[12];"休眠期"智能体在对话间隙重组记忆[15]。这一模式在被测量前已应用于实践:社区对维基模式的描述列出*检查*步骤——验证矛盾、过时主张、孤立页面、缺失交叉链接——作为工程习惯但无正式评估[3],已发表的最接近系统仅评估下游回答准确率,从未评估库本身[1,2]。

我们直接研究库本身,采用机器学习最古老的框架:*训练/测试*。知识库即模型。监督问题逐个到达;训练智能体基于当前库回答每个问题,接受评分,然后在显式整合阶段编辑库结构,使该问题的*类别*更易被未来读者处理。评估冻结库并在持有问题上检验无标准答案访问权且操作预算固定的独立阅读器。

此类训练产生的价值最佳理解为*索引构建*:数据库在构建索引时不改变数据,但查询变得更廉价。每个训练问题的验证推理路径被物化为*访问结构*——多跳链成为可遍历的链接路径,搜索难以处理的键获得索引文档以链接其下所有内容,因此未来读者支付查找成本而非重新推导成本,一次性成本在可计算数量问题后得到回报。

贡献:

1. 1. 智能体训练的知识库,以及为何监督是结构构建的高效方式。我们让大语言模型智能体在标准机器学习范式下*训练*文档库,知识库扮演模型角色:监督(问题,答案)对逐个消费;每次迭代运行前向传播(从当前库回答)和反向传播(揭示标准答案后*编辑库*——添加、删除和链接文档,构建索引文档);持有集性能即为损失。与离线构建(GraphRAG、RAPTOR、HippoRAG)在机器学习术语上精确对应:那些方法是*无监督*的,从语料库推断结构而无标签及未来查询概念,而(问题,答案)对是我们的标签,结构针对验证答案优化。由此获得的优势可量化且属于效率而非上限。按每个索引点计算,监督策展的操作节省量和准确率分别是覆盖全量的无监督实体索引的1.6倍和1.8倍,因为它将结构构建在问题实际发生处:1,913条链接对比196,112条,且94%的链接指向真正应归入其键下的文档。且结构能泛化,在可用的端点上:训练时两个键均被索引的问题获得+0.167 F1提升,一个键被索引时为+0.100,未被索引时衰减为零。该衰减按*覆盖度*索引而非问题新颖性,因此随训练持续而消退。我们的绝对数字仅因一百个训练问题覆盖四分之一语料库而落后于无监督基线,且覆盖度随消费问题线性增长——差距在于训练量而非方法。监督还能与部署组合,这是离线构建无法实现的:循环逐个消耗问题并就地编辑,因此库能从实时流量中持续学习,将其结构集中在实际服务的查询分布上。
2. 2. 知识库的训练/测试协议:两阶段(前向/反向)训练迭代、单次标准答案揭示、操作预算下的冻结库检验、学习曲线,以及*键覆盖梯度*——一种通过变化训练集对测试问题关键信息覆盖比例的探测,将"是否泛化"转化为可测量的衰减曲线而非二元判断。
3. 3. KBGym,一种无污染的PhantomWiki风格环境[8]:虚构人物宇宙渲染为原子单句文档图;十类诊断问题及精确答案与支撑集;确定性、整数精确的库指标,且无大语言模型判断器参与任何测量——评分采用SQuAD规范化对比程序化标准答案,系统中唯一的大语言模型判断器用于守护库内去重,不涉及报告数字。

## II 相关工作

检索增强生成与智能体检索。经典RAG使用学习的稠密检索器从冻结语料库检索并基于结果生成[16,17,18,19]:语料库是输入而非输出。智能体式RAG将检索移入推理循环,与推理交错进行[20,9],分解为子问题,在低置信度时检索[10],或学习检索-或-推理策略[21,11]。我们的阅读器*正是*这种循环。区别在于哪一方学习:那条路线针对固定语料库改进查询侧策略;我们固定策略并训练库。这两个轴正交且可组合。

在语料库上构建结构。GraphRAG[4]、RAPTOR[5]、LightRAG[28]和HippoRAG[29,6]在任何问题到达*前*构建实体图、摘要层次或PageRank链接知识图。这些是我们的最强基线和自然对比:它们的结构是无监督的且盲目构建于查询分布之上,而我们的结构由实际提出的问题逐步雕刻。在参数化方面,ROME和MEMIT编辑模型权重内的事实关联[35,36];我们追求非参数化补充——事实存于可检查、重组和审计的外部库中,编辑可跨模型迁移。STaR式引导[37]仅保留验证的推理用于进一步训练;我们的前向/后向迭代继承了那种预测-然后-学习形式,但以库而非权重为学习对象。

智能体维护的库与智能体记忆。近期系统让智能体在问答期间编写和更新维基页面,或在文档流下维护时变维基[1,2,3];STORM[27]通过多视角研究生成维基百科式文章——一次性创作而非持续维护。另一条并行路线跨情境累积经验——外部记忆分页[22]、链接的长期笔记存储[23,12]、对事件流的反思[24],以及蒸馏反馈或可复用工作流[25,26,7]。这些系统中产出物是提示或为单一智能体服务的私有记忆;我们的则是共享、可检查的文档库,其策展质量本身即是被测结果。

无污染地衡量记忆。已发表的策展系统仅报告下游任务分数:库本身从未被测量,问题上无训练/测试划分,且评估语料库受参数化污染。LongMemEval及后续系统通过跨会话问答探测助手记忆[13];LoCoMo评估超长期对话记忆[34];MemDelta记录隐藏混淆因素并主张控制基线[14],支持我们的无库基线规范。多跳问答数据集——HotpotQA[30]、MuSiQue[31]、2WikiMultiHopQA[32]——提供带标注支撑的真实文本问题,但其公共语料库对当前模型已污染。PhantomWiki[8]生成无污染的虚构宇宙并具有程序化精确答案;我们的生成器遵循其配方,SQuAD式规范化[33]提供评分。我们的协议添加了缺失的测量层。

初始库K0:原子文档,无链接  
训练迭代(q,a*)  
*阶段1* 前向(N1):搜索/阅读→回答↪结果显示a*, F1  
*阶段2* 反向(N2):添加/编辑/删除/链接/解链→完成  
×150个问题 ×纪元数  
训练后库KT:链接+导航文档  
检验(库冻结)  
新阅读器:搜索/阅读/回答,预算M  
持有问题,标准答案永不显示  
F1(非劣等?)  
每个问题步骤数(ρ<1?)  
图1:训练/测试协议。训练智能体消费监督问答对,基于当前库回答每个问题(仅在其单次回答后揭示标准答案),并将验证推理整合为结构。评估冻结库并在持有问题上检验独立预算阅读器;假设(公式1)为以严格更低的每问题成本实现非劣等准确率。

## III 问题形式化

知识库K是一个由*文档*构成的有向图,每个文档是自包含句子及其出边,因此库的学习成果可见于其结构而非隐藏于文本中。任何智能体看到或写入的仅两个字段:文本(搜索匹配的单句)和链接(阅读遵循的边)——阅读返回文档及其链接的所有完整文本,这使连接良好的文档能替代一系列不确定的搜索。*索引文档*并非独立类型,而是文本命名某键且价值在于其链接的文档;无标记表明其为索引,因此无链接的索引与无人需要的句子无法区分。另有三个字段由环境维护且对智能体不可见,使测量不依赖其配合:来源(文档代表的原始事实,原创时为空)、标志(未接触/原创/编辑)和吸收(合并折叠的来源)。它们共同使账目精确。

*阅读器*是固定的大语言模型策略,具有搜索、阅读和回答功能,固定操作预算M,以及仅保存当前问题和最近k个操作-结果对的记忆。其在问题分布Q上的行为定义库在两个轴上的质量:acc(K)=E_q[F1(reader(K,q))]和cost(K)=E_q[steps(reader(K,q))]。*训练*是任何消耗监督对(q,a*)并编辑K,从K0产生KT的过程。

此类过程应学习的是*访问结构*,这一区别重要,因为操作集允许类似学习的捷径。库可获得*内容*——陈述事实的文档,包括库已蕴含的内容,如刚验证的答案——或*访问结构*:价值在于所携链接的索引文档,以及链必须跨越的边。仅后者能泛化。记录验证答案的文档服务于产生它的实例,而该实例不会重现;键上的索引服务于搜索命名该键的所有问题。因此我们的假设是关于访问结构的声明,我们在准确率和成本之外衡量可导航性:

acc(KT)≥acc(K0)−δ 且 ρ=cost(KT)/cost(K0)<1 (1)  
其中边界δ=0。

相似文章

KARLA: 基于知识库增强检索的语言模型

arXiv cs.AI

KARLA 提出了一种方法,让大型语言模型在生成过程中查询知识库,从而无需重新训练即可更新事实知识,并提高透明度。实验表明,该方法在短文本和长文本生成中均提升了事实依据性。

利用知识图谱路径作为自进化搜索代理的中间监督

arXiv cs.AI

本文介绍了一种利用知识图谱路径作为中间监督来提升自进化搜索代理性能的方法。该方法通过将问题构建建立在关系上下文之上,并引入航点覆盖奖励(Waypoint Coverage Reward)以实现分级部分奖励,从而解决了搜索自博弈(Search Self-Play)中的瓶颈问题。

结构促进检索、重排序与生成

arXiv cs.CL

本文提出SF-Re2G方法,通过利用文档结构来增强检索、重排序和生成,从而改进基于文档的对话系统。该方法在中英文数据集上得到验证。

将结构化生物医学知识注入语言模型:持续预训练与GraphRAG对比

arXiv cs.CL

# 将结构化生物医学知识注入语言模型:持续预训练与GraphRAG 来源:[https://arxiv.org/html/2604.16422](https://arxiv.org/html/2604.16422) ###### 摘要 将领域特定知识注入模型对于使语言模型(LMs)适应生物医学等专业领域至关重要。尽管目前大多数方法依赖于非结构化文本语料库,但本研究探讨了两种利用UMLS元术语表(Metathesaurus)中结构化知识的互补策略: