通过预测性导航进行深度研究预训练

arXiv cs.CL 论文

摘要

介绍了深度研究预训练(DRP),一种离线框架,从引文和超链接证据结构中生成搜索-打开-撰写轨迹。在1B token上预训练的Qwen3-14B模型在深度研究基准测试中优于匹配的无DRP基线,即使使用较少的监督微调数据也是如此。

arXiv:2608.00432v1 公告类型:新 摘要:深度研究智能体通常训练于昂贵、基于环境的工具使用轨迹,需要重复检索、文档检查和报告评估。我们引入了深度研究预训练(DRP),一种离线框架,从自然发生的证据结构中推导预测性导航监督。给定包含引文或超链接的段落,DRP构建一个代理研究目标,恢复链接证据和图相关的替代项,并将其转换为搜索-打开-撰写轨迹。这教会模型搜索什么、检查哪些文档以及如何综合证据,而无需实时检索环境或执行策略回滚。我们在学术引文图(DRP-Paper)和维基百科超链接(DRP-Web)上实例化DRP,分别在1B token上持续预训练独立的Qwen3-14B-Base模型,并在13K代理轨迹的受控比例上进行微调。在每个低数据预算下的五个独立采样子集上,两种变体在DeepResearch Bench上均持续优于匹配的无DRP模型。使用SFT数据的四分之一,DRP-Web甚至超越了固定的完整数据无DRP检查点,其收益转移至ResearchQA、WebWalkerQA和SimpleQA。从匹配的低数据SFT检查点开始,DRP-Web的优势在后续的智能体RL中也持续存在。来源匹配和证据不匹配对照表明,这些改进源于证据条件导航,而非领域暴露或智能体格式模仿。因此,DRP为基于轨迹的智能体训练提供了一种有前景的补充方法。
查看原文
查看缓存全文

缓存时间: 2026/08/04 07:42

# 深度研究预训练:通过预测性导航

来源:https://arxiv.org/html/2608.00432

###### 摘要

深度研究智能体通常是在昂贵且基于环境交互的工具使用轨迹上训练的,这些轨迹需要反复检索、文档检查和报告评估。我们提出深度研究预训练(Deep Research Pretraining, DRP),这是一种离线框架,从自然出现的证据结构中派生预测性导航监督。给定一段带有引用或超链接的文本,DRP构造一个代理研究目标,恢复链接证据和图相关替代项,并将其转换为搜索–打开–写作轨迹。这教会模型应该搜索什么、检查哪些文档以及如何综合证据,而无需实时检索环境或执行策略展开。我们在学术引用图(DRP-Paper)和Wikipedia超链接(DRP-Web)上实例化DRP,分别在1B token上持续预训练独立的Qwen3-14B-Base模型,并在13K智能体轨迹的受控子集上对它们进行微调。在五个独立抽样的低数据预算子集上,两种变体在DeepResearch Bench上均一致优于匹配的无DRP模型。仅使用四分之一SFT数据,DRP-Web甚至超过了固定的无DRP全数据检查点,其收益还转移到了ResearchQA、WebWalkerQA和SimpleQA。从匹配的低数据SFT检查点出发,DRP-Web的优势在后续的智能体RL过程后依然保持。源匹配和证据不匹配的对照实验表明,这些改进来自基于证据的导航,而非领域暴露或智能体格式模仿。因此,DRP为基于轨迹的智能体训练提供了一种有前景的互补方法。

## 1 引言

参见图1:DRP概述。从目标报告及其自然证据图出发,DRP推断出一个代理研究目标,从支持证据和相关替代项构建搜索候选集,并综合生成一个基于历史条件的搜索–打开–写作轨迹。搜索和打开观测从图邻域和源文档中离线渲染,无需实时检索环境或策略展开。

语言模型智能体将推理与外部行动和观测交替进行,以解决多步任务(Yao等人, 2023)。其能力通常通过在任务特定、基于环境的轨迹上进行后训练来激发(Nakano等人, 2021;Shao等人, 2025)。生成此类数据需要可执行环境、长程展开、反复工具使用和结果评估,因此每条可用轨迹成本高昂。深度研究是这些成本被放大的代表性场景。深度研究智能体必须重构查询、浏览多个来源、选择证据、从低效探索中恢复,并综合生成基于来源的报告。近期方法使用教师生成的轨迹或在真实或模拟搜索环境中进行强化学习来训练这些能力,通常由报告级评分标准引导(Jin等人, 2025;Zheng等人, 2025;Sun等人, 2025;Shao等人, 2025)。虽然有效,但这些方法仍然依赖于昂贵的交互、轨迹构建或评估。

然而,文档集合中已经包含了独立于智能体展开而自然出现的证据结构。带有引用和超链接的文本将综合后的内容与支持它的文档关联起来,而引用图或超链接图中的邻近节点则提供了相关但未被选中的替代项。这些关系可能能够监督深度研究中的核心决策:搜索什么、检查哪些文档,以及如何综合得到的证据。因此,我们提出以下问题:*文档之间自然存在的关系能否被转化为无需展开的预训练监督,从而提高下游智能体训练的轨迹样本效率?*

我们的目标不是取代下游智能体后训练,而是提供一种初始状态,降低其对昂贵、基于环境的轨迹的依赖。我们提出深度研究预训练(DRP),这是一种离线框架,从自然存在的证据结构中反向合成此类监督,而非要求教师执行完整的浏览展开。图1总结了从自然证据图到预测性导航轨迹的流程。从一段作为目标报告的带引用或超链接文本出发,DRP构造一个代理研究目标,恢复链接来源,并从周围的引用或超链接拓扑中提取图相关替代项。然后,它将这些要素渲染为搜索–打开–写作轨迹。我们将学习目标称为*预测性导航*:以研究目标和迄今观察到的证据为条件,模型学习预测要搜索什么、检查哪些文档,以及如何综合收集到的证据。由于候选集和文档内容都是从证据图和源语料库中离线组合的,构建DRP数据既不需要实时检索环境,也不需要执行策略展开。

我们在两个结构不同的领域实例化DRP。**DRP-Paper**将带引用的相关工作段落视为目标报告,从内容中推断代理研究目标,使用解析后的引用论文作为证据,并抽样拓扑邻近但未被引用的论文作为候选替代项。**DRP-Web**将相同的构造应用于Wikipedia段落:在过滤掉附带提及后,其外链页面中实质性贡献于该段落的页面构成证据集,而超链接图中的邻近节点提供相关替代项。尽管领域特定的抽取规则不同,两种变体都使用相同的搜索–打开–写作动作空间和预测性导航目标渲染监督。图仅用于离线数据构建;下游智能体使用标准搜索和打开工具进行运作。

我们将DRP评估为智能体SFT之前的持续预训练。从Qwen3-14B-Base出发,我们在1B token的DRP-Paper或DRP-Web上训练独立模型,然后在来自DR Tulu(Shao等人, 2025)的13K GPT-5生成的深度研究轨迹的受控子集上对它们进行微调。这里,样本效率定义为性能作为下游训练所用专家轨迹数量的函数。在两个低数据预算的五个独立抽样子集上,DRP-Paper和DRP-Web在DeepResearch Bench上一致优于匹配的无DRP SFT。仅使用四分之一的轨迹,DRP-Web还超过了固定的全数据Base检查点。正向的低数据收益转移到ResearchQA、WebWalkerQA和SimpleQA,并且1/16-SFT效应在Qwen3-30B-A3B上依然存在。从匹配的1/16-SFT检查点出发,DRP-Web在整个80步ARPO风格智能体RL过程中也保持领先于Base。源匹配的原始文档和证据不匹配对照实验支持以下假设:收益来自证据条件导航,而非仅领域暴露或智能体格式模仿。

我们的贡献可总结为:
- 我们提出DRP,这是一种离线反向综合框架,将引用和超链接关系转化为基于历史条件的搜索–打开–写作监督,而无需执行智能体展开。
- 我们在学术引用图和Wikipedia超链接图上实例化DRP,并表明固定的1B token DRP阶段在独立抽样的低数据子集上持续提高下游轨迹SFT的样本效率。
- 源匹配的原始CPT和证据不匹配对照实验支持以下假设:DRP受益于证据条件导航,而非仅受益于领域暴露或智能体格式。

## 2 方法

### 2.1 问题形式化

设 \(\mathcal{C}=\{d_{v}\}_{v\in\mathcal{V}}\) 为带证据图 \(\mathcal{G}=(\mathcal{V},\mathcal{E})\) 的文档语料库。有向边记录两个文档之间的自然关系,例如学术引用或Wikipedia超链接。从锚定文档中,我们提取带引用或链接的段落 \(r\) 作为目标报告,并恢复一组证据顶点 \(E_{r}\subseteq\mathcal{V}\)(1),其关联文档 \(\{d_{v}:v\in E_{r}\}\) 被该段落引用并与之实质性相关。然后我们推断一个代理研究目标 \(u\),其答案由 \(r\) 表达。令 \(y=\mathrm{Normalize}(r,E_{r})\) 表示在仅保留可解析证据后从 \(r\) 获得的最终报告目标。

深度研究轨迹既包含中间导航决策,也包含最终报告。我们将渲染后的轨迹写为
\[
\tau=\left(u,\left((z_{i},a_{i},o_{i})\right)_{i=1}^{T},z_{\mathrm{w}},y\right),
\]
(2)
其中 \(z_{i}\) 是推理轨迹,\(a_{i}\) 是搜索或打开动作,\(o_{i}\) 是其观测,\(y\) 是最终报告,前面由写作推理 \(z_{\mathrm{w}}\) 引导。在决策 \(i\) 处,模型仅以因果历史 \(h_{i}=(u,((z_{j},a_{j},o_{j}))_{j<i})\) 为条件。预测性导航目标定义为:
\[
\max_{\theta}\sum_{i=1}^{T}\log p_{\theta}(a_{i}\mid h_{i})+\log p_{\theta}(z_{\mathrm{w}},y\mid h_{T},z_{\mathrm{w}})
\]
(3)
为了保持标准自回归语言模型目标,在渲染后,每步的搜索/打开观测 \(o_{i}\) 作为输入中的上下文被包含;随后是完整的 \(z_{\mathrm{w}}\) 和 \(y\),模型在它们上面计算标准下一token交叉熵损失。①

在给定历史情况下,预测 \(a_{i}\) 是从离线构造的数据中学习的,而不是由环境提供的。搜索动作表示为查询字符串;打开动作表示为要阅读的文档标题集。这种结构允许模型学习自然可迁移的搜索和打开工具策略。

### 2.2 从引用和超链接到离线轨迹

数据构造接收一个锚定文档,并从其自然图结构中提取一个源匹配的真实轨迹。图2说明了这一过程。

**锚定目标和源匹配报告。** 我们从每个锚定文档中选择带有引用或超链接的段落。为DRP-Paper,我们从学术文档中提取相关工作部分;为DRP-Web,我们从Wikipedia页面中提取带链接的段落。将选定的段落归一化,使每个证据引用在文本中只出现一次。

**证据恢复。** 对于DRP-Paper,我们从段落文本中解析引用标记,并将每个引用匹配到其参考文献列表中的条目;无法解析的引用被丢弃。对于DRP-Web,我们解析超链接,过滤掉非页面链接、模板和附带提及(页面提及但未实质性贡献于文本)。其余链接构成证据集。

**代理目标。** 在渲染时,报告是证据的综合,但报告本身并未明确陈述其研究目标。我们提示一个构造器来描述报告并输出一个代理目标。可以使用较小的模型或少量人为编写的规则来完成。在我们的实现中,我们使用LLM生成器。

**候选集。** 给定证据集和锚定文档,我们从图结构中采集候选替代项。对于每个证据顶点,我们考虑其入边和出边邻居;从锚定文档的图邻域中未选作证据的顶点构成候选集。目标是模拟一个真实的搜索轮次,该搜索轮次可以同时返回已识别证据和与目标相关的未选文档。

**从观察图到搜索/打开观测。** 在训练时,搜索观测必须由候选集和文档内容渲染,而非由实时检索系统渲染。我们构建查询,使得检索到的结果列表与候选集匹配;打开观测由所选证据文档渲染而成。我们在此将细节推迟到§A.2。

### 2.3 轨迹模板

每个搜索动作 \(a_i^S\) 在构造上选择一组证据文档 \(P_i\),通过一个查询表示。我们从其标题和短文片段渲染选中证据的搜索观测。每个打开动作 \(a_i^O\) 选择 \(P_i\) 的一个子集,\(K_i\),作为精读打开。为动作观测生成查询和渲染结果涉及候选集与选定集的匹配。我们通过应用确定性匹配启发式来引导生成,结合§A.2中的手动检查员。然后,我们使用注入文档事实的LLM生成器来填充推理字符串。在所有实验中,渲染来自一个单一冻结的LLM,并且使用高度限制性的系统提示词。若要构造更多数据,只需替换为该LLM的独立运行。

第一轮搜索。对于目标 \(u\),第一轮搜索从整个证据集中选择一个非空子集 \(P_1\),并生成查询 \(q_1\)。候选文档来自图邻域。在训练时,模型看到:用户目标、查询、第一轮搜索结果以及(在一个决策步骤中)属于 \(P_1\) 的证据文档。

后续轮搜索。对于第 \(i>1\) 轮,模型看到历史 \(h_i\) 中的目标、先前动作和观测,从剩余证据中选择非空子集 \(P_i\),并生成查询 \(q_i\)。查询 \(q_i\) 必须满足:其检索结果作为候选集是合理的,并且 \(P_i\) 中的特选文档在结果中突出显示。

打开。在\(i\)轮中,模型看到候选集但仅打开 \(P_i\) 的一个子集 \(K_i\)。它选择要精读的文档——即当页搜索候选集中真正影响最终报告的那部分相关文档。训练目标是在给定候选集的情况下预测 \(K_i\) 的标题。

写作。最后,模型编写一份报告 \(y\),综合所有打开的证据 \(K_i\),且只包含这些证据。从渲染的数据中写作,将预测性导航目标与从原始语料库中提取的自然报告对齐。

### 2.4 实现细节与基线

**预训练数据规模与格式。** 在单次DRP通过中,轨迹 \(\tau\) 被序列化为标准聊天格式:系统提示词包含轨迹级元数据;每轮交替消息代表推理、搜索和打开动作。在渲染多个轨迹时,我们不跨轨迹进行打包。在1B token的持续预训练中,轨迹来源于两个领域:DRP-Paper和DRP-Web,我们在每个领域上分别训练模型。对于DRP-Paper,我们从一组arXiv论文和相关工作段落中构建数据;对于DRP-Web,我们从一组Wikipedia文章片段构建数据。在两种情况下,我们都过滤掉长度过短或过长的轨迹(少于100个token或高于128K个token),并按曲线长度对剩余轨迹进行排序。

**基线:基础预训练。** 主要的基线是在与DRP相同的1B token预算内,从相同基础语料库中提取的原始文档上进行持续预训练(CPT)。这衡量了“仅领域暴露”是否足以解释所观察到的改进。我们在图3、图4和图7中将其报告为“Base”。由于基础数据是原始语料库中的文档(不包含搜索/打开模板),我们保持总token匹配。

**无DRP SFT。** 给定一个固定的基础检查点,我们直接使用轨迹子集进行SFT,这是主要的基线。对于“固定全数据Base”检查点,在完整13K轨迹上对原始Base进行SFT。我们将“低数据Base检查点”定义为对1/16或1/4轨迹子集进行SFT的原始Base。我们对低数据设置匹配数据子集和种子。

**DPO基线。** 我们还在一个较小的消融环境中将DRP与DPO进行比较,即以搜索/打开决策位置为条件的偏好对。在准备DPO对时,我们使用DRP轨迹,将动作 \(a_i\) 替换为一个随机选择的不匹配证据候选作为被拒绝的续接。我们发现DRP在低数据SFT中产生了显著更好的基础模型初始化,而DPO在我们尝试的设置中并未带来一致的收益。

## 3 实验

### 3.1 设置

**基础模型。** 除非另有说明,我们使用Qwen3-14B-Base① 作为所有CPT、SFT和RL实验的基础骨干,并额外使用Qwen3-30B-A3B-Base② 检查规模泛化。在使用任何DRP或基线数据之前,我们从官方权重开始。

**DRP数据的规模与构成。** DRP-Paper数据来自作为锚定文档的arXiv论文及其相关工作部分;DRP-Web数据来自Wikipedia文章及其带链接的文本部分。我们按域独立构建数据,并构建两个非重叠数据集。每个DRP数据集在1B token预算下可以运行许多轮;每个训练周期从候选池中抽取一个新的随机轨迹子集,因此每个token大约被访问一次。我们报告1B token的DRP结果。

**下游智能体SFT数据。** 我们使用DR Tulu发布的13,062条GPT-5生成的深度研究轨迹。每个轨迹从自然语言任务开始,包括带工具调用的多轮搜索/打开消息,以最终报告结束。该数据集被划分为训练/评估部分;我们从训练部分随机抽取低数据子集。低数据SFT的数据抽样在独立种子上重复进行。

**下游评估基准。** 我们的主要评估基准是DeepResearch Bench,这是一个需要多步搜索、来源选择和多段落综合的深度研究任务套件。我们还报告ResearchQA、WebWalkerQA和SimpleQA上的结果,以评估搜索导航和事实性。

**训练细节。** 所有CPT、SFT和RL实验均使用OLMo-core、AdamW,并以全局批大小2M token运行。CPT运行500个优化器步骤,产生1B token的训练。SFT运行5个epoch(使用各自的数据子集)。RL实验使用ARPO风格的设置,进行80步。更多超参数在§A.3中给出。

### 3.2  DRP 提升了低数据轨迹SFT的样本效率

我们首先检查主要目标:DRP的持续预训练是否提高了下游智能体训练的轨迹样本效率。我们在两个DRP变体、五个低数据轨迹子集和两个低数据预算上评估效果。

首先,我们在随机抽样的 \(1/16\) 和 \(1/4\) 轨迹子集(分别为815条和3,265条开发者SFT轨迹)上对原始Base进行SFT。其次,我们从相同的五个种子中抽样这些子集,在给定DPR(DRP-Paper或DRP-Web)CPT之后使用相同的SFT配方训练。图3展示了在DeepResearch Bench上的结果。

**结果。** 两种DRP变体在每个种子和每个数据预算上均优于匹配的Base。在1/16和1/4数据下,DRP-Web的平均改进分别为+0.9分和+0.7分。DRP-Paper得分略低但与DRP-Web相当:平均改进分别为+0.7和+0.5。这证实DRP的持续预训练提高了下游轨迹SFT在深度研究中的样本效率。值得注意的是,在1/4轨迹数据下,DRP-Web超过了在完整13K轨迹上SFT的固定Base检查点。这表明,当目标是在有限的轨迹预算下训练一个深度研究智能体时,在自然证据结构上的持续预训练可以部分替代昂贵的工具交互轨迹。

### 3.3 迁移到其他基准

低数据SFT模型在DeepResearch Bench上的改进可能反映了任务特异性过拟合。为检查泛化性,我们在不改变任何训练配方的情况下,在三个额外基准上评估了1/16-SFT检查点:ResearchQA(复杂、多来源问答)、WebWalkerQA(网页导航和证据收集)以及SimpleQA(事实性)。由于这些基准不直接要求深度研究报告输出,我们使用与DR Tulu相同的方法:在评估时将模型输出与前缀约束解码进行比较,或使用评估器对生成的答案进行评分。DR Tulu为两个任务引入了一个标准的提示词模板,我们在所有方法中保持该模板不变。

结果见表1。对于每种设置,DRP始终在三个基准上优于匹配的Base SFT,除了一个例外(在WebWalkerQA上DRP-Paper与Base持平)。这表明DRP并未以牺牲其他智能体能力为代价来提高DeepResearch Bench,而是带来了广泛的导航和证据使用收益。

### 3.4 特征归因:证据条件导航 vs. 领域暴露或格式模仿

DRP预训练包含三个可分离的组成部分:来自原始文档语料库的领域暴露、智能体格式(搜索–打开–写作模板)以及证据条件导航目标。哪个因素驱动了观察到的收益?为回答这个问题,我们比较了DRP-Web与其两个控制变体:

**基线的原始CPT。** 一个在相同Wikipedia或arXiv文档上以相同token预算进行CPT的模型,可作为领域暴露控制。它不接收任何搜索/打开模板,也不接收预测性导航目标。

**证据不匹配CPT。** 为将格式与证据条件导航分开,我们训练一个模型,其中数据构造与DRP相同,但每个动作的观测内容是从一个固定的、可复现的随机池中抽取的,而不是匹配目标文档。这保留了智能体格式,但切断了动作与证据之间的条件关系。我们将其称为“证据不匹配CPT”。

我们在表2中报告了1/16-SFT和1/4-SFT的结果。原始CPT仅带来很小的收益(与直接从Base进行SFT相比),而证据不匹配CPT带来了中等但一致的收益。在相同token预算下,DRP-Web在两种低数据预算下都比最佳控制变体高出约+0.5分。这表明观察到的改进不能仅用领域暴露或格式模仿解释;它主要来自基于证据的导航目标。

### 3.5 与替代性预训练目标对比

我们将DRP与在相同1B token预算下可能的替代性预训练目标进行比较。由于我们使用了基于LLM的构造函数,一个自然的替代方案是预测在给定历史情况下下一个检索文档的标题,而非预测查询和打开动作。我们考虑了一个消融变体,其中训练目标仅包含一个单一的“搜索”动作,并在同一轨迹子集上评估它(表3,DRP w/o Open)。与完整DRP相比,这种消融显著降低了收益:查询预测是预测性导航的关键部分。我们还尝试了一个仅使用报告预测的变体(DRP w/o Search),它作为从同一基础文档中提取的事件报告执行标准语言建模;它没有带来可测量的改进。

### 3.6 超参数与数据组成

我们在1/16-SFT预算下对DRP-Web进行了消融。在500步CPT中,将DRP数据量从1B token减少到0.5B token会降低收益;将token预算增加到2B并没有进一步提高结果。在数据构成方面,我们观察到过滤短于100个token或长于128K token的轨迹与不过滤相比没有显著影响。当每个证据部分从多个锚定文章(对于Wikipedia)中抽样时,收益稍有改善,但变化很小。

### 3.7 使用DRP初始化进行智能体RL

深度研究智能体的最终性能通常通过与轨迹或性能评估相关的RL进一步微调。在我们的主要SFT评估中,DRP的收益是否在进一步的RL之后依然存在?我们按照DR Tulu的配方(ARPO风格)对1/16-SFT检查点进行80步RL,使用相同的奖励模型,并在DeepResearch Bench上评估最终策略。

我们比较了:(i)1/16-SFT Base + RL;(ii)1/16-SFT DRP-Web + RL。表4报告了结果。DRP-Web的RL模型优于Base的RL模型。两种模型的绝对改进相似,表明DRP的收益与下游RL互补,而非被其覆盖。

## 4 相关工作

**用于智能体后训练的交互数据。** 语言模型智能体通常通过模仿专家轨迹或从策略展开中进行强化学习来训练。用于训练的工具使用数据集通常由在一个环境中的执行生成,该环境提供观测和奖励。与我们的区别在于,DRP完全离线构建轨迹,且构图不涉及任何执行费用。

**自我对弈和合成数据。** 合成数据生成已被广泛用于程序合成、数学和工具使用。对于代理任务,合成数据通常基于手写提示和执行的验证器构建;最近的工作使用弱模型监督或来自多种LLM的偏好信号来构建搜索轨迹。我们的工作与这些不同,因为干预是在标准代理后训练*之前*,且轨迹来自文档结构,而非模型生成的随机搜索。

**预训练目标与领域适应。** 在任务特定领域(如代码、数学或网络文本)上进行持续预训练是标准做法。结构化预训练目标,如去噪或实体替换,可以改进下游任务,而无需任务特定的交互数据。DRP扩展了这一范式,使用文档图中的关系来创建搜索和打开预测目标,而非仅用于文本去噪。

**深度研究智能体。** 近期工作已经证明了深度研究智能体在多个环境中超越人类基线,从网络搜索和学术搜索开始。训练方法包括教师轨迹SFT和RP。我们的贡献是一种补充性的预训练策略,它增加了一种不存在于标准轨线集合中的证据条件导航信号。

**图神经网络与文档图。** 文档图提供了多跳推理的结构信号,相关的工作使用图神经网络或预训练目标来利用文档间的关系。我们将文档图用作离线训练数据的来源,但我们的下游模型不包括任何图结构;它仅通过标准搜索和打开工具进行操作。

## 5 结论

我们引入了深度研究预训练(DRP),这是一种离线预训练框架,将自然的文档关系(引用和超链接)转化为预测性导航监督。我们的方法不需要实时检索环境或执行策略展开。DRP在两种不同的文档图结构(学术引文图和Wikipedia超链接图)上一致提高了下游深度研究智能体在低数据SFT和RL中的样本效率。消融实验证实了证据条件导航目标相对于单纯领域暴露和格式模仿的贡献。DRP代表了一种互补且经济高效的方法,可用于深度研究智能体的后训练。

## 附录

### A.1 数据构造细节

- 从锚定文档中选择带引用或链接的段落。
- 解析引用或链接以恢复证据文档。
- 通过图邻域构建候选集。
- 生成搜索轨迹(查询和轮次)。
- 生成打开轨迹(打开决策)。
- 根据候选集和打开决策渲染搜索和打开观测。
- 过滤暴露隐藏构造过程的轨迹。

### A.2 轨迹生成提示词

#### 段落选择提示词

给定一个文档 \(d_a\),选择一个段落 \(r\),其中包含对证据文档 \(E_r\) 的引用或链接,满足:
- 该段落不是目录、参考列表或导航框。
- 至少有 \(E_{\min}\) 个证据。
- 每个证据在段落文本中最多出现一次(归一化后)。

#### 代理目标生成提示词

给定一个报告(段落),生成一个代理研究目标:
```
你是一名深度研究的数据构建器。给出一个综合性写作的样本,你的目标是生成该样本所回应的研究问题。输出一个单一的自然语言问题,使得该样本是关于该问题的合理综合。问题应具体且包含足够的信息,以一个明确的研究目标结尾。输出格式:问题: <问题文本>
```

#### 搜索轨迹候选提示词

给定锚定文档、证据集和候选集,提示词生成一个分组的、多轮的搜索计划:
```
给出以下文档证据(标题+摘要);构造一个现实的搜索计划,该计划将逐步找回这些证据。候选页面列表在所有轮次的检索结果中可用。
## 步骤
- 读取证据,并按子主题分组。
- 每一轮应有一个查询,该查询返回与某个子主题匹配的页面。
- 每轮查询应具有“子主题级别”的具体性,而非仅指出单个页面。
- 输出计划。
```

#### 证据到查询句子生成提示词

将 \(P_i\) 中的证据转换为查询语句:
```
给出选中证据的标题和摘要,构造一个能高概率返回这些页面的搜索查询。查询应简洁、特定于子主题,并可包括若干关键词。输出:查询: <查询文本>
```

#### 候选页面列表的生成

```
给出一个目标报告和一个候选文档列表,选择将要打开(阅读全文)的候选文档。输出被选中文档的ID。
```

#### 构建搜索观测

搜索观测包含一个模拟的检索结果页面,该页面具有“标题–摘要”条目。我们使用BM25对文档进行简要排名,然后人工检查修复明显的错误匹配。这个离线渲染过程使得每个训练示例都能在无限多样的查询下运行,无需实时检索。

#### 搜索/打开/写作推理的提示词

给定已渲染的观测,对每个推理字符串使用一个单一的冻结LLM。所有提示词均包含严格的内容限制,以维持可比的推理风格。下面给出每个提示词的模板。

**第一轮搜索推理。** 模型看到目标 \(u\)、查询 \(q_1\) 以及证据文档的渲染标题/摘要,并生成一个推理字符串 \(z_i^S\)。

**后续轮搜索推理。** 模型看到目标 \(u\)、前几轮中打开的证据、查询 \(q_i\) 以及渲染的候选文档。它生成一个推理字符串,描述为何该搜索是自然的下一步。

**打开推理。** 模型看到渲染的候选文档列表和 \(K_i\),并生成一个推理字符串,说明为何确切地选择这些文档。

**写作推理。** 模型看到目标 \(u\) 和所有打开文档的标题/摘录,并生成一个写作计划 \(z_w\)。

**过滤规则。** 我们不允许推理字符串提及隐式构造过程(例如,“我看到了一个列表”、“在提供的候选中”)。还禁止讨论“搜索尚未成功”或“结果不相关”,因为这会泄露离线oracle。我们对每次生成最多重试三次;如果每次均失败,则丢弃该轨迹。

#### 构建搜索观测的示例(略)

### A.2.1 来自模板的推理生成

在所有提示词中,模板生成的字符串作为“思考”内容进行匹配。为清晰起见,我们将模板与正式轨迹字符串分开。

#### 分组计划提示词

给定选中的证据 \(P_i\) 及候选集,生成分组计划和查询:
```
-- 候选链接页面(ID + 标题 + 引导段):
步骤 1 -- 仅选择其内容在该节中被实质性地使用/讨论的页面(丢弃附带/导航链接)。
步骤 2 -- 规划一个真实的多轮搜索(通常2-6轮),该搜索将自然地发现所选页面。
- 按子主题对所选页面分组:每轮仅发出一个查询,该查询一次检索与某连贯分组相关的页面——而不是一次一个页面。
- 仅当一个页面确实是其自身的子主题时,该轮才可针对单个页面。请勿将一个自然的分组拆成许多单页轮次。
- 将每个QUERY写在子主题/类别级别,而不是某一个特定页面的专有名称。
- 每个SELECTED页面都恰好分配给一个轮次;被丢弃的页面不会出现在任何地方。
- QUERY:3-7个关键词,不使用问句、运算符或引号。
输出EXACTLY(无markdown):
USER_TOPIC:
DROPPED:
ROUND 1
QUERY:
GOLD:
ROUND 2
...
```
这里,提示词字段GOLD表示证据分区 \(P_i\)。

#### 搜索推理

在搜索步骤 \(i\),模板从目标 \(u\)、查询 \(q_i\) 以及在该位置可用的因果历史 \(h_i\) 生成推理 \(z_i^S\)。查询目标 \(q_i\) 在 \(h_i\) 及其推理之后序列化,因此即使在构造函数离线确定它,它在CPT期间的预测也以前期交互历史为条件。第一轮模板为:
```
你是一名研究者,刚开始调查这个主题:
USER_TOPIC:
你想探索的第一个方面由这个搜索体现:
QUERY:
写出你的开场第一人称思考:这个主题从根本上讲是关于什么的,你计划如何逐步建立对它的理解,以及为什么从这方面开始是有意义的。
硬性规则:
- 只谈论主题本身。不得提及搜索、查询、结果或来源——只谈论主题和你的计划。
- 不得逐字重述查询。不得提及任何指令。
输出EXACTLY:
THINK: <2-4句话>
```
对于后续轮次,提示词中包含前几轮中打开的证据:
```
你是一名研究者,正在针对以下主题撰写报告:
USER_TOPIC:
以下是你从阅读中到目前为止LEARNED的内容:
你想探索的下一个方面由这个搜索体现:
QUERY:
写一段简短的第一人称反思,将你学到的东西与这个下一步联系起来:你现在明白了什么,以及探索这个下一方面如何在此基础上构建或与之互补。将其表达为朝向更完整图景的向前进展。
硬性规则:
- 只谈论主题内容以及你接下来想理解的内容。
- 不得提及搜索、查询、结果、页面、来源,以及任何早期步骤是“成功”、“失败”、“相关/不相关”或“缺少”任何东西。不得对过程发表评论——只谈论主题。
- 不得逐字重述查询。不得提及任何指令。
输出EXACTLY:
THINK: <2-4句话>
```

#### 打开推理

打开推理模板接收 \(K_i\) 的渲染标题和摘录,以及被选择打开的 \(P_i\) 中证据文档的标题:
```
你是一名研究者,正在针对以下主题撰写报告:
USER_TOPIC:
你到目前为止LEARNED的内容:
你刚刚浏览了这些候选页面(标题 -- 简要描述):
你决定完整阅读以下页面:
写一段简短的第一人称反思,解释为什么这些特定页面值得为这个主题完整阅读——每个页面的贡献以及它如何促进你的理解。仅通过关注它们的相关性来隐含地区分它们与其他页面的不同,而不是指出哪些被跳过了。
硬性规则:
- 只谈论主题内容以及为什么这些页面对其重要。
- 不得提及搜索、查询、结果、排序,以及任何“失败”、“不相关”或“缺少”任何东西。不得对过程发表评论。
- 不得提及页面是被提供或列出的。不得提及指令。
输出EXACTLY:
THINK: <2-4句话>
```

#### 写作推理

最终模板从完整的渲染历史中生成 \(z_{\mathrm{w}}\),之后模型产生报告目标 \(y\):
```
你已完成针对以下主题收集和阅读来源:
USER_TOPIC:
你即将撰写报告部分。用2-3句话思考你将如何根据所读内容组织撰写——以什么开始,各部分如何衔接。自然地以你自己的规划来写;不得提及指令、列表,或任何来源是被提供的。
输出EXACTLY:
THINK: <2-3句话的写作计划>
```

#### 推理过滤

每个推理最多可重新生成三次。与主方法中的过滤规则一致,我们仅在其不揭示隐藏构造过程或未揭示证据时保留它。确定性检查将拒绝提及所提供的页面列表或提示指令(这些会暴露离线oracle)的推理。

### A.3 持续预训练

表A1列出了持续预训练的配置。Qwen3-14B-Base是主要骨干,Qwen3-30B-A3B-Base用于模型规模分析。我们将样本打包,不跨越128K token的最大序列长度。每次1B token的运行包含500个优化器步骤,全局批大小为2M token,在128个H20 96GB GPU上大约需要六小时。CPT使用OLMo-core,训练随机种子为42。

| 超参数 | 值 | 超参数 | 值 |
|---|---|---|---|
| 训练token | 1B | 优化器 | AdamW |
| 最大序列长度 | 128K | Adam \((\beta_1,\beta_2)\) | \((0.9,0.999)\) |
| 全局批大小 | 2M token | Adam \(\epsilon\) | \(10^{-8}\) |
| 峰值学习率 | \(4\times 10^{-5}\) | 权重衰减 | 0 |
| 学习率调度 | 余弦衰减至0 | 梯度裁剪 | 1.0 |
| 预热比例 | 0.1 | 精度 | BF16 |

表A1:持续预训练超参数。

### A.4 下游智能体SFT

我们使用DR Tulu(Shao等人, 2025)发布的13,062条英文GPT-5生成轨迹。¹¹¹ 遵循其SFT配方,我们在 \(1/16\)、\(1/4\) 或全部轨迹上对模型进行微调,每个设置训练五个epoch。

相似文章

Mind DeepResearch 技术报告

Hugging Face Daily Papers

# 论文页面 - Mind DeepResearch 技术报告 来源:[https://huggingface.co/papers/2604.14518](https://huggingface.co/papers/2604.14518) ## 摘要 MindDR 是一个高效的多智能体深度研究框架,通过协作式三智能体架构与专门设计的四阶段训练流程,在多个基准测试中取得优异成绩。我们提出 Mind DeepResearch(MindDR),一个高效的[多智能体深度研究框架](https://hug