深度研究的交互式范式
摘要
SteER 是一个用于可引导深度研究的框架,通过自适应暂停决策和实时用户画像建模,在过程中引入可解释的控制,在对齐方面比基线高出 22.80%,并在超过 85% 的成对对齐判断中受到人类读者的青睐。
查看缓存全文
缓存时间: 2026/05/26 09:01
# 深度研究的交互式范式
来源:https://arxiv.org/html/2605.24266
###### 摘要
大型语言模型(LLMs)的最新进展使得深度研究系统能够结合检索、推理和生成,为开放式查询合成全面、报告式的答案。然而,大多数框架依赖于僵化的工作流程,包括一次性的范围界定和长时间的自运行,如果用户意图在过程中发生转变,几乎没有修正的余地。我们提出 SteER,一个可引导的深度研究(Steerable deEpResearch)框架,它在长时程研究工作流程中引入了可解释的中途控制。在每个决策点,SteER 通过成本-收益公式来决定是暂停等待用户输入,还是自主继续。它结合了多样性感知规划和奖励对齐、新颖性和覆盖率的效用信号,并维护了一个在会话中不断演变的实时角色模型。SteER 在对齐度上比最先进的开源和专有基线高出最多 22.80%,在广度、平衡性等质量指标上领先,并且在 85% 以上的成对对齐判断中为人类读者所偏好。我们还引入了角色-查询基准和数据生成流水线。据我们所知,这是首个以交互式、可解释的控制范式推进深度研究的工作,为长时任务中可控、与用户对齐的智能体铺平了道路。
机器学习,ICML
## 1 引言
| 系统 | 中途引导 | 自适应暂停决策 | 实时角色建模 |
|---|---|---|---|
| **深度研究框架(开源)** | | | |
| DeepResearcher (zheng2025deepresearcher) | ✗ | ✗ | ✗ |
| Search-r1 (jin2025search) | ✗ | ✗ | ✗ |
| ManuSearch (huang2025manusearch) | ✗ | ✗ | ✗ |
| Search-o1 (li2025search) | ✗ | ✗ | ✗ |
| GPT-Researcher (gptresearcher) | ✗ | ✗ | ✗ |
| Open Deep Research (opendeepresearch) | ◆ | ✗ | ✗ |
| ERD (prabhakar2025enterprisedeepresearchsteerable) | ✓ | ✗ | ✗ |
| **深度研究框架(专有网页版)** | | | |
| OpenAI Deep Research (openaideepresearch) | ◆ | ✗ | ✗ |
| Google Gemini Deep Research (googledeepresearch) | ◆ | ✗ | ✗ |
| **交互式/角色感知推理框架** | | | |
| PersonaAgent (zhang2025personaagent) | ✗ | ✗ | ✓ |
| ReasonGraph (li-etal-2025-reasongraph) | ✓ | ✗ | ✗ |
| HITL CoT MCS (cai2023human) | ✓ | ✗ | ✗ |
| **SteER** | **✓** | **✓** | **✓** |
表 1:深度研究框架(开源和专有)以及交互式/角色感知推理框架在中途引导(通过自适应暂停决策)和实时角色建模方面的比较。据我们所知,SteER 是首个同时提供所有这些功能的可基准测试深度研究框架。
大型语言模型(LLMs)的最新进展已将信息获取从排序检索转向了生成全面、报告式答案以应对复杂且开放式查询的系统 (du2025deepresearch)。这些 *深度研究* 系统,涵盖专有平台 (googledeepresearch; openaideepresearch; xaideepresearch) 和开源框架 (gptresearcher; opendeepresearch),将迭代检索与多步推理相结合,以合成有充分依据的输出 (coelho2025deepresearchgym)。
诸如 DeepResearchGym (coelho2025deepresearchgym) 和 DeepResearch Bench (du2025deepresearch) 等基准已开始标准化这一设定,为长篇幅、引文密集型报告提供逼真的研究式问题和自动评估协议。然而,这些基准根据通用质量标准评估研究式查询和长篇报告;它们并未提供衡量系统在适应个体用户时的对齐度和聚焦度所需的 *角色条件化、方面锚定的目标*。这留下了评估交互式、可引导的研究智能体的空白,而我们通过一个角色-查询套件来解决这一问题,该套件将适合深度研究的查询与查询条件化的角色及可操作的方面检查表配对。
在系统方面,当前的深度研究智能体主要分为两种范式:多智能体流水线(划分规划、搜索和合成)(huang2025manusearch; alzubi2025open; li2025search; zhang2025evolvesearch) 和经过 RL 训练的智能体(学习有效搜索和推理)(zheng2025deepresearcher; jin2025search; song2025r1)。然而,无论架构如何,大多数系统都遵循僵化的流程:一次性范围界定(通常只进行一次澄清),然后长时间自主运行。如果用户意图中途发生变化,几乎没有修正的空间,导致成本浪费和报告不匹配。这凸显了对另一种设计的需求,即中途交互成为核心,而非可选。
两个研究线索与我们的工作密切相关。**个性化与对齐** 研究如何根据用户意图定制 LLM 输出,从轮廓条件化生成 (Wu et al., 2025 (https://arxiv.org/html/2605.24266#bib.bib6)) 到长篇幅检查表 (Salemi et al., 2024 (https://arxiv.org/html/2605.24266#bib.bib3); salemi2025lamp) 以及交互式偏好引导。尽管这些工作展示了个性化的价值,但大多数假设固定角色或将对偏好建模与系统控制分离,缺乏确定何时寻求输入的原则性方法。**交互式推理** 研究 LLM 如何提出澄清问题 (andukuristar; ren2023robots; Wu et al., 2024 (https://arxiv.org/html/2605.24266#bib.bib5))、建模未来轮次 (ICLR2025_97e2df4b),或学习澄清策略 (DBLP:conf/iclr/Chen0PA25)。这些方法解决的是 *局部澄清* 瓶颈——检测当前请求中的歧义,并决定是直接回答还是先询问——而非一个端到端的策略,以决定在长时程轨迹中何处暂停、暂停如何与探索权衡、以及用户目标应如何在过程中演变。一个互补的线索是暴露推理痕迹供人类审查:**交互式推理** (pang2025interactive) 将思维链渲染为可编辑的主题层次结构,**ReasonGraph** (li2025reasongraph) 可视化顺序或树状推理路径。这些工具提高了透明度和监督,但提供的是 *静态可视化*,而非自适应暂停机制或实时角色模型,后者在单个长时程研究树中调节规划、分支效用和合成。
现有方法要么优化自主智能体,要么将澄清孤立为一项狭窄技能。相比之下,我们旨在提供一个集成的控制范式,在过程中共同调控暂停、探索和个性化。我们提出 SteER,一个可引导的深度研究(Steerable deEpResearch)框架,将交互式控制引入长时程研究工作流程(图 1 (https://arxiv.org/html/2605.24266#S1.F1))。关键直觉是,深度研究应该偶尔 *提问*,而不仅仅是 *回答*:SteER 在每个决策点使用成本-收益公式来决定是暂停等待用户输入,还是自主继续。为了既与用户对齐又保持探索性,它结合了多样性感知规划和奖励对齐、新颖性和覆盖率的效用信号。一个实时角色根据交互不断更新,并调节所有下游规划、评分和合成,使系统能够随着用户需求的变化进行调整。表 1 (https://arxiv.org/html/2605.24266#S1.T1) 将 SteER 定位在深度研究框架和交互式/角色感知推理系统之中。大多数深度研究系统仍然进行一次性范围界定,然后长时间自主运行:一旦发出查询,固定的流水线就会执行到底,无法以可解释的方式干预研究树或决定何时寻求指导(◆ 表示一次性的前期范围界定/计划确认步骤)。同时期的工作 EDR (prabhakar2025enterprisedeepresearchsteerable) 通过公开的任务计划添加了用户发起的中途引导,但缺乏自适应暂停策略和实时角色建模。交互式/角色感知系统处理互补的方面:它们维护不断演进的用户表示,或暴露推理供审查和手动修正,但并未实现一个决定 *何处* 暂停以及 *如何* 平衡自主性与控制的自适应暂停策略。相比之下,据我们所知,SteER 是首个同时支持中途引导、自适应暂停机制和实时角色建模的可基准测试深度研究框架。
我们的贡献如下:
- • 我们提出了 SteER,一个交互式深度研究框架,在研究循环中支持可解释的中途控制和动态用户对齐。
- • 广泛的实验表明,SteER 在角色定制性和报告质量上超越了最强的开源和专有 OpenAI 基线,同时提供了细粒度控制来调整对齐度与用户负担之间的权衡,以及探索不足与过度个性化之间的权衡。一项人类研究进一步证实了读者对它的偏好,在对齐度、聚焦度和可用性方面有显著提升。
- • 我们引入了一个角色-查询评估套件和一个可复用的数据生成流水线,该流水线基于先前的基准,适用于未来交互式深度研究智能体的评估和训练。
总之,SteER 持续优于强大的开源和专有基线,实现了 7.83%–22.80% 更高的对齐度,并在广度、平衡性等通用质量指标上领先。人类读者在超过 85% 的对齐度和 83% 的聚焦度成对比较中偏好 SteER。据我们所知,**这是首个以交互式、可解释的控制范式推进深度研究的工作**。我们相信,这一范式转变将塑造未来的长时程研究智能体,使其能够采用适应个体用户及其不断变化需求的决策策略,而非依赖一次性的事前澄清。
参见图注
图 1:SteER 概述。上方面板显示端到端流水线。下方面板放大显示了三个核心模块:**规划**、**暂停决策** 和 **角色建模**。
## 2 SteER
### 2.1 问题设定与目标
我们将可引导的深度研究形式化为一个交互式规划任务。给定用户查询 \(Q\),系统逐步构建一个研究树,并生成一份附带引用的综合报告 \(R\)。目标是生成一份高质量且与用户不断演变的偏好相一致的报告,同时将中断次数保持在最少且时机恰当。每个用户由一个角色 \(P = (p_{\text{text}}, \mathcal{A})\) 表示,其中 \(p_{\text{text}}\) 是结合了轮廓和个性特征的自然语言描述(遵循 Wu et al. (2025 (https://arxiv.org/html/2605.24266#bib.bib6))),而 \(\mathcal{A}\) 是用户期望在最终报告中得到处理的一组方面。我们沿两个互补维度评估报告:(1) **对齐度**:报告覆盖 \(\mathcal{A}\) 中方面的程度;(2) **聚焦度**:报告内容相对于 \(\mathcal{A}\) 保持主题相关的比例。
### 2.2 系统概述
我们的框架 SteER 将单一的深度研究流水线转变为交互式过程。该系统围绕三个核心组件构建:**多样性感知探索**、**暂停决策** 和 **角色建模**。在高层,该框架增量地构建一个代表可能探索路径的研究树,并在关键的检查点有选择地让用户参与。我们将研究树记为 \(\mathcal{T} = (N, E)\),其中每个节点 \(n \in N\) 代表一个带有部分研究结果的子问题查询,每条边 \((n, n') \in E\) 表示分解为子方向。树逐层扩展,直至最大深度 \(D\),这是一个控制合成前探索层数的超参数。在每一步,系统在**前沿节点** \(n^\star\) 上操作,并执行以下操作(图 1 (https://arxiv.org/html/2605.24266#S1.F1)):
1. **多样性感知探索**:从 \(n^\star\) 生成候选后续方向,并选择一个大小为 \(K\) 的多样化子集作为潜在扩展(见图 1 中的**规划**面板)。
2. **暂停决策与扩展**:计算分支效用、执行成本以及询问的预期收益,并将其与暂停成本进行比较。如果触发暂停,则将多样化子集呈现给用户,然后扩展用户选择的项以及任何新建议的方向。否则,直接扩展系统提议的多样化子集。子智能体随后在每个扩展的子节点上执行检索和推理,以生成节点级报告(见图 1 中的**暂停决策**面板)。
3. **角色建模**:利用来自查询、初始轮廓以及暂停期间收集的任何用户反馈的信号,更新推断的角色 \(\hat{P}\)。更新后的角色在后续步骤中调节规划、效用评分和合成(见图 1 中的**角色建模**面板)。
该过程在深度 \(D\) 的所有节点都已扩展时终止,此时累积的节点报告被聚合为最终报告 \(R\)。这个交互式循环使得报告能更好地与用户目标对齐,同时最小化冗余或偏离主题的探索。
### 2.3 多样性感知探索
如第 2.2 节所述,在每个前沿节点 \(n^\star\),系统生成一组后续问题作为潜在的下一步。为了促进探索并减少冗余,我们明确提示考虑**不同的侧面**,并包括一个**通配**方向(详见附录 K 中的提示)。从这个候选集中,我们选择一个大小为 \(K\) 的多样化子集,用于呈现给用户(如果触发暂停)或自动扩展。为了选择该子集,我们应用贪婪的最大边际相关性(MMR)策略 (carbonell1998use; wang2025diversity),该策略平衡置信度分数与先前选择方向的不相似性。MMR 特别适合我们的设定:它简单、高效且可解释,同时有效鼓励不同方面的主题覆盖。相比之下,其他多样性方法(例如聚类或行列式点过程)会引入额外的复杂性和超参数,在此情境下没有明显增益。附录 C 提供了完整的算法细节。
### 2.4 暂停决策与扩展
在提案阶段产生多样化的候选集后,系统必须决定是让用户参与还是自主继续。处处询问是不可取的:用户对中断的容忍度有限且因人而异。有些用户更喜欢高层指导,同时信任系统处理细节;另一些用户则更注重细节,但只希望在特定主题上拥有控制权。偏好也会随着研究树的深度和时间的推移而变化。一个校准良好的系统必须尊重这些偏好,同时将探索引导向用户的目标。下面,我们以自顶向下的结构呈现暂停决策机制:我们从总体决策规则开始,然后分解其组成部分,包括暂停成本、预期收益和分支效用。
#### 决策规则
在每个前沿节点 \(n^\star\),系统评估暂停询问用户是否有益。此决策被形式化为成本-收益比较:
\[
a(n^\star) =
\begin{cases}
\textsc{PauseAsk}, & \Delta EV(n^\star) > C(n^\star),\\[2.0pt]
\textsc{Proceed}, & \text{otherwise.}
\end{cases}
\]
这里,\(\Delta EV(n^\star)\) 表示预期效用相似文章
FineSteer: 大规模语言模型推理时细粒度控制的统一框架
FineSteer 是一个新颖的推理时控制框架,将控制分解为条件控制和细粒度向量合成两个阶段,采用子空间引导条件控制(SCS)和混合控制专家(MoSE)机制来提高安全性和真实性,同时保持模型效用。实验表明在 TruthfulQA 上相比最新方法有 7.6% 的性能提升,且效用损失最小。
STRIDE-ED: 一个策略驱动的多步推理框架用于同情心对话系统
STRIDE-ED 是一个为同情心对话系统设计的策略驱动推理框架,它结合了结构化的多阶段推理、数据精化管道和两阶段训练(有监督微调 + 多目标强化学习)来改进情感理解和回复生成。该框架在开源大语言模型上的自动评指标和人工评估上都展示了一致的改进。
通过迭代元反射实现自主科学发现
DiscoPER 是一个自主框架,利用大型语言模型和动态代码生成进行开放式科学研究,通过二阶元反射综合发现结果,并采用统计检验确保严谨性。在多模态生态基准测试中,它在恢复已知模式方面优于基线方法。
通过联合生成与评估实现自进化深度研究
来自香港科技大学、字节跳动和UCL的研究人员提出了SCORE——一种协同进化训练框架,将LLM同时训练为深度研究报告生成器和评估器,并通过元约束机制动态调整评估难度,防止奖励饱和。实验表明,该方法在开放式研究报告质量上取得了持续提升。
通过定向干预实现语言模型的多属性引导
MAT-Steer 提出了一种新颖的推理时干预框架,通过学习稀疏且正交的引导向量,选择性干预与每个属性相关的标记,从而在多属性冲突场景下引导大型语言模型,在问答任务和生成任务上的表现均优于现有方法。