WikiLoop:联合学习构建与导航智能体原生Wiki并利用下游反馈
摘要
WikiLoop是一个反馈耦合框架,联合学习构建与导航智能体原生Wiki,通过共享策略和充分性优先于效率的目标,在多个基准测试上提升答案正确性。
arXiv:2607.26604v1 公告类型:新
摘要:知识库构建与查询通常独立优化:检索增强型智能体在固定的外部维护索引上运行,而构建过程则无法从下游使用中获得信号。我们提出WikiLoop,一个反馈耦合框架,联合学习构建与导航智能体原生Wiki——一种专为机器导航设计的持久化链接页面知识库。基于角色条件的共享策略支持两种接口:导航器从Wiki中检索证据以回答查询,构建器提出结构化编辑并通过下游导航进行评估。导航器遵循充分性优先于效率的目标,仅在全量证据收集完成后才施加检索成本惩罚。构建器从效用差异中学习:冻结的导航器根据每个候选编辑对下游性能的改变进行评分,同时通过防护惩罚抑制对无关查询的性能退化。训练过程结合了顺序角色特定优化与最终在角色同质批次上的联合阶段。以Qwen3.5-9B为公共骨干,WikiLoop在AuthTrace上达到62.6的聚合答案正确率,比基础版LLM-Wiki高出6.3个百分点,在多文档查询上提升最大。受控比较支持两个目标的预期效果,且学到的编辑对保留的导航器仍然有用。配对比较表明,最终共享策略基本保留了两种角色特定能力,相比相应的专家参考,导航器答案正确率和端到端答案正确率提升了0.4个百分点,并将两种接口合并到一个模型中。无需数据集特定训练,WikiLoop在HotpotQA和MuSiQue上也优于同骨干网络的LLM-Wiki基础版。
查看缓存全文
缓存时间: 2026/07/30 09:58
# WikiLoop:通过下游反馈联合学习构建与导航智能体原生维基
来源:https://arxiv.org/html/2607.26604
###### 摘要
知识库构建与查询通常被独立优化:检索增强智能体基于固定且外部维护的索引运行,而构建过程则无法接收到来自下游使用的反馈信号。我们提出 WikiLoop,一个反馈耦合框架,用于联合学习构建与导航一个智能体原生维基(agent-native Wiki)——一种专为机器导航设计的持久化链接页面知识库。一个角色条件化的共享策略支持两个接口:导航器(Navigator)从维基中检索证据以回答问题,而构建器(Builder)则提出结构化编辑,其效果通过下游导航进行评估。导航器遵循“充分性先于效率”的目标,仅在收集完全部证据后方施加检索成本惩罚。构建器则从效用差异中学习:一个冻结的导航器根据候选编辑对下游性能的变化进行评分,同时通过一个保护性惩罚来抑制无关查询上的性能退化。训练过程结合了顺序的角色特定优化与最后在角色同质批次上的联合阶段。以 Qwen3.5-9B 作为共用主干模型,WikiLoop 在 AuthTrace 上达到了 62.6 的聚合答案正确率,比 LLM-Wiki, base 高出 6.3 个百分点,其中多文档查询的增益最大。对照实验支持了两个目标的预期效果,且学习到的编辑对未参与训练的导航器仍然有效。成对比较表明,最终的共享策略在很大程度上保留了两个角色的特定能力,相较于相应的专家参考策略,导航器及端到端答案正确率提升了 0.4 个百分点,并将两个接口整合到一个模型中。在没有数据集特定训练的情况下,WikiLoop 在 HotpotQA 和 MuSiQue 上相较于相同主干模型的 LLM-Wiki, base 也有所提升。
## 1 引言
检索增强语言模型通过基于外部证据(而非仅依赖参数记忆)来条件化生成,从而回答知识密集型问题(Lewis 等, 2020; Karpukhin 等, 2020)。使用工具的智能体通过将推理与检索交错进行,允许后续动作依赖于轨迹早期获取的证据,从而扩展了这一范式(Yao 等, 2023; Trivedi 等, 2023)。然而,支持这些智能体的知识工件通常是通过一个独立的构建过程产生的。结构化系统可能将语料组织成递归摘要、图或链接的维基页面,但其构建目标在很大程度上仍然与下游智能体收到的反馈相分离(Sarthi 等, 2024; Edge 等, 2024; Ming 等, 2026)。这种分离引发了一个核心问题:当持久化知识库的效用由后续导航决定时,应如何构建它?
*智能体原生维基*是一种持久的、面向机器导航(而非仅用于人类浏览)的结构化知识库(Ming 等, 2026)。它通过链接页面组织语料信息,将综合知识与对支持源片段的引用相结合。导航器通过显式的搜索和阅读动作访问此状态,并跟随页面间链接;而构建器则应用符合模式约束的补丁,创建或修改页面、链接和引用。因此,维基既是一个检索基底,也是一个持久化状态,其组织方式可通过下游智能体反馈进行优化。
联合学习维基构建与导航面临三个优化挑战。首先,自适应检索方法学习是否、何时以及如何检索(Asai 等, 2024; Jeong 等, 2024; Fang 等, 2026),但其目标仍需在证据充分性与检索效率之间取得平衡。统一的成本惩罚可能倾向于在收集所有必要证据之前就终止的较短轨迹。其次,构建器需要为每个编辑的边际效果获得评分。绝对的编辑后性能会混淆编辑质量与编辑前维基的质量,而针对目标查询的无约束增益可能会导致无关查询的性能退化。现有工作使用下游答案效用训练检索组件(Liu 等, 2026),并通过编辑前后可恢复性为记忆更新分配评分(Yan 等, 2026)。但对于持久化维基,评分必须反映单个编辑的边际下游效用,同时考虑对无关查询的性能退化。第三,导航器和构建器使用不同的状态、动作空间和奖励。尽管一个语言模型可以支持多个检索或工具使用角色(Zhu 等, 2025; Mo 等, 2025),但联合优化可能引入干扰,因此一个角色的增益不必保留给另一个角色。共享策略必须协调两个目标,同时保留每个角色的专门能力。
我们提出**WikiLoop**,一个反馈耦合框架,在角色条件化的共享策略中将维基构建与下游导航连接起来。如图1所示,联合监督微调初始化两个角色,随后是导航器强化学习、使用冻结导航器评估器的构建器强化学习,以及在交错角色同质批次上的联合强化学习。导航器优先考虑证据充分性,然后才考虑检索效率,而构建器则从独立维基编辑所引发的下游效用差异中学习。
我们的贡献有三点:
1. **反馈耦合的智能体原生维基学习。** 我们将构建与导航形式化为一个角色条件化策略内的耦合学习问题,并开发了一个先专门化、后整合两个接口的顺序流程。两个角色在相同的结构化维基上运行,共享所有可训练参数,同时保留不同的提示、状态、动作模式和奖励。
2. **针对导航与构建的角色特定目标。** 充分性门控导航将成本压力延迟至完全证据覆盖之后,而受保护的效用差异监督则为结构化编辑分配边际评分。冻结的导航器对独立的编辑前/编辑后维基状态进行评分;受影响的查询与保护性查询分别衡量目标增益和无关查询退步;未参与训练的导航器则测试编辑是否能够迁移至训练评估器之外。
3. **机制对齐的评估与实证证据。** 使用 Qwen3.5-9B,WikiLoop 在 AuthTrace(Wu 等, 2026)上达到了 62.6 的总体答案正确率,分别比 Joint SFT 和 LLM-Wiki, base 高出 4.4 和 6.3 个百分点。对照实验支持了两个角色特定目标的预期效果。在训练历程中,导航器答案正确率从 Joint SFT 后的 58.2 提升至 NAV-RL 后的 60.4,在 BUILD-RL 后略微下降至 59.7,并在 Joint RL 后恢复至 60.8,最终得到一个支持两个接口的单一策略。在相同主干模型下,零样本迁移到 HotpotQA 和 MuSiQue(Yang 等, 2018; Trivedi 等, 2022)上的提升,以及更大规模的实验结果,进一步评估了迁移能力。
## 2 相关工作
**检索与智能体知识访问。** 检索增强生成与密集段落检索确立了在生成前从外部语料中选择证据的标准模式(Lewis 等, 2020; Karpukhin 等, 2020)。ReAct 和 IRCoT 通过将语言模型推理与检索或其他动作交错来将此模式扩展到迭代访问(Yao 等, 2023; Trivedi 等, 2023)。更近期的系统直接学习检索决策:Self-RAG 通过反思令牌学习检索与批评,Adaptive-RAG 基于估计复杂度将查询路由到不同检索策略,SPARKLE 训练一个结构化策略用于自适应检索(Asai 等, 2024; Jeong 等, 2024; Fang 等, 2026)。Agentic-R 通过结合局部相关性与全局答案正确性,将下游监督纳入检索器学习(Liu 等, 2026)。这些方法优化了证据访问或检索器本身。WikiLoop 则相反,使用检索结果来监督被访问的持久化结构化工件,而其导航器目标将证据充分性置于检索成本之前。
**记忆写入与知识编辑。** 结构化检索系统用专为多步访问设计的工件取代了扁平段落集合。RAPTOR 递归地将文本聚类并总结为检索树,GraphRAG 结合实体图与社区摘要,HippoRAG 在图结构化的长期记忆上进行检索(Sarthi 等, 2024; Edge 等, 2024; Gutiérrez 等, 2024)。HippoRAG 2 将段落融入此记忆公式,而 LightRAG 支持增量图索引(Gutiérrez 等, 2025; Guo 等, 2025)。LLM-Wiki 将知识组织成链接的、智能体可导航的页面,并提供了 WikiLoop 所采用的表示(Ming 等, 2026)。WikiLoop 保留了这一表示,但根据编辑的边际下游效用学习结构修改,从而将工件构建与后续使用相连接。
**智能体记忆系统**更明确地将写入作为一项动作。MemGPT 跨记忆层级管理信息,A-Mem 动态创建并链接结构化记忆(Packer 等, 2023; Xu 等, 2025)。Memory-R1 和 AgeMem 通过强化学习训练策略来管理记忆操作(Yan 等, 2025; Yu 等, 2026)。HiMPO 通过共享写入前状态下的编辑前后可恢复性来估计轨迹内记忆更新的效用,并为记忆写入令牌分配后见过滤的评分(Yan 等, 2026)。WikiLoop 则学习对持久化结构化维基进行符合模式约束的编辑。一个冻结的下游导航器独立评估每个候选补丁;受影响的查询和保护性查询分别衡量目标增益和无关查询退步;另有一个单独训练的未参与导航器测试编辑是否能够迁移至训练评估器之外。因此,两种方法共享编辑前后评分原则,但优化不同的对象和接口:HiMPO 优化轨迹内记忆写入令牌,而 WikiLoop 优化对外部结构化维基的符合模式约束的编辑。
**角色条件化的智能体学习。** 角色条件化允许一个模型通过共享策略接口支持异构的智能体行为。RoleRAG 对多个 RAG 功能进行角色特定的令牌优化,而 MATPO 研究工具集成模型中规划者和工人角色之间的策略优化(Zhu 等, 2025; Mo 等, 2025)。WikiLoop 将共享策略条件化为在相同持久化维基上进行导航或构建。各角色保留不同的状态表示、动作空间和奖励函数,而角色同质批次协调它们的优化。
## 3 方法
图1:WikiLoop 概览。导航器在一个结构化维基上检索证据,遵循“充分性先于效率”的目标。构建器提出结构化补丁,其下游效用由冻结的导航器在编辑前/编辑后独立维基状态下衡量。顺序的 NAV-RL 和 BUILD-RL 之后是联合强化学习,该阶段交错角色同质的导航器与构建器批次,最终得到一个单一的角色条件化共享策略。### 3.1 问题形式化与框架概览
WikiLoop 基于 LLM-Wiki(Ming 等, 2026)引入的链接页面维基表示。维基状态 \(W\) 由结构化页面、页面间链接以及对源文档的引用组成。给定一个查询,**导航器**发出搜索和阅读动作,跟随链接,积累证据,并返回答案。给定一个新来源和当前维基状态,**构建器**提出一个符合模式约束的结构化编辑 \(e\),用于创建或修改页面、链接和引用。
每个候选编辑配有一个受影响集合 \(Q_{\mathrm{affected}}\),包含预期因该编辑而受益的查询,以及一个保护性集合 \(Q_{\mathrm{guard}}\),用于检测非预期的退步。一个冻结的导航器在应用编辑 \(e\) 前后,对独立维基状态执行这两个集合,然后根据下游效用的变化对编辑进行评分。这种构造根据消耗该维基的下游智能体所产生的后果,为每个编辑分配评分。
一个共享策略通过条件化于活跃角色 \(r\) 来代表两个角色:
\[
\pi_{\theta}(a_t \mid s_t, r),\quad \pi_{\theta}^{N} = \pi_{\theta}(\cdot \mid r = \mathrm{NAV}),\quad \pi_{\theta}^{B} = \pi_{\theta}(\cdot \mid r = \mathrm{BUILD}). \tag{1}
\]
导航器和构建器共享模型参数,但保留不同的角色提示、状态表示、动作空间和奖励函数。图1总结了维基状态、两个角色接口、构建器反馈路径以及顺序优化阶段。
训练按顺序进行。联合监督微调首先得到 \(\theta_0\),随后策略演化如下:
\[
\theta_0 \xrightarrow{\mathrm{NAV\text{-}RL}} \theta_N \xrightarrow[\bar{\pi}_N \ \mathrm{frozen}]{\mathrm{BUILD\text{-}RL}} \theta_B \xrightarrow[\bar{\pi}_N \ \mathrm{frozen}]{\mathrm{Joint\ RL}} \theta_J. \tag{2}
\]
在 NAV-RL 之后,我们将导航器接口复制为 \(\bar{\pi}_N = \pi_{\theta_N}^{N}\),并在整个 BUILD-RL 和 Joint RL 过程中保持其固定。BUILD-RL 产生构建器专门化的状态 \(\theta_B\),随后的联合阶段产生最终的角色条件化共享策略 \(\pi_{\theta_J}\)。
这种顺序安排首先为构建器提供了一个训练好的下游导航器。冻结 \(\bar{\pi}_N\) 使候选编辑的效用尺度在过程中保持稳定,相似文章
@hwchase17: https://x.com/hwchase17/status/2071963622298050997
文章讨论了AI代理中新兴的'wiki记忆'模式,其中原始源数据被智能压缩成一个持久、结构化的知识层,代理可以高效地使用它。文章将其与基础RAG进行了比较,并给出了DeepWiki和LLM Wiki等例子。
OpenWiki Brains: AI代理的主动记忆(7分钟阅读)
LangChain推出OpenWiki Brains,这是一个为AI代理提供主动记忆的框架,可自动从Gmail、Notion和git仓库等连接源构建和更新维基。
WiCER:面向 LLM Wiki 系统的 Wiki 记忆编译、评估与精炼迭代式知识编译
本文介绍了 WiCER,这是一种将领域知识编译到 LLM Wiki 系统中的迭代算法,旨在最大限度地减少知识蒸馏过程中的信息丢失和灾难性失败率。研究表明,与盲编译方法相比,该方法通过更好地保留关键事实,改进了全上下文 KV 缓存推理的效果。
我将 wikiLLM 改造为“智能体即开发者”用例——以下是改动内容及原因
一位没有机器学习背景的产品经理将 wikiLLM 改造为“智能体即开发者”,使其能够在遇到意外情况时自动生成上下文,并将重复出现的模式升级为经过验证的规则,从而将强制上下文减少约 80%,并避免重复处理已解决的问题。
OpenWiki:CLI工具,用于为你的代码库编写和维护代理文档
OpenWiki是LangChain的一个CLI工具,可自动生成和维护代码库的文档,专为AI代理设计。它支持多个推理提供商,并可与GitHub Actions集成以实现每日更新。