基于信息增益的展开策略优化:面向多轮LLM智能体的自适应树结构展开方法

arXiv cs.AI 论文

摘要

提出了IGRPO框架,该框架基于中间状态的信息性为多轮LLM智能体自适应分配展开预算,将自适应树结构探索与策略学习相统一。在七个搜索增强型问答基准上的实验表明,该框架一致优于基线方法。

arXiv:2607.06223v1 Announce Type: new Abstract: 强化学习已成为改善大语言模型(LLM)智能体在长期搜索任务中的一种有前景的范式,其中智能体必须在获得最终结果之前做出中间决策序列。然而,现有方法仍面临一个关键限制:展开预算的分配往往没有明确评估中间状态的价值。因此,即使不同分支的信息性差异很大,大量计算也可能被浪费在低价值状态上。在本文中,我们提出基于信息增益的展开策略优化(IGRPO),这是一个将中间状态信息性作为展开收集组织原则的策略优化框架。具体而言,IGRPO通过根据节点级信息性分配扩展预算来执行预算感知的树结构展开,从而使信息性更强的分支被更频繁地扩展,同时逐步抑制无前途的分支。我们进一步证明,基于信息增益的展开会在轨迹上诱导出一个显式的限制性教师分布,这自然产生一个清晰的策略优化目标,从而在单一框架内统一了自适应树结构探索与原则性策略学习。在七个具有挑战性的搜索增强型问答基准上的实验表明,IGRPO在相同的展开预算约束下一致优于强基线,验证了利用诱导的教师分布指导长期搜索智能体策略优化的有效性。
查看原文
查看缓存全文

缓存时间: 2026/07/08 04:39

# 基于信息增益的展开策略优化:面向多轮LLM智能体的自适应树结构展开方法  
来源:https://arxiv.org/html/2607.06223  

Yijun Zhang∗  Fan Xu∗  Jiaxin Ding†  Yule Xie  Shiqing Gao  Xin Ding  
Haoxiang Zhang  Luoyi Fu  Xinbing Wang  
上海交通大学  
∗同等贡献。†通讯作者。  

###### 摘要  

强化学习已成为改善大语言模型(LLM)智能体在长视界搜索任务上的有效范式,在此类任务中,智能体需要在获得最终结果前做出一系列中间决策。然而,现有方法仍面临一个关键局限:展开预算的分配通常没有明确评估中间状态的效用。因此,大量计算可能被浪费在低价值状态上,尽管不同分支的信息量可能差异巨大。在本文中,我们提出基于信息增益的展开策略优化(IGRPO),一种将中间状态信息量作为展开收集组织原则的策略优化框架。具体而言,IGRPO通过根据节点级信息量分配扩展预算,执行预算感知的树结构展开,使得信息更丰富的分支被更频繁地扩展,而无望的分支则被逐步抑制。我们进一步证明,基于信息增益的展开会诱导出一个显式的限制性教师分布,该分布自然提供了一个清晰的策略优化目标,从而将自适应树结构探索与有原则的策略学习统一在单个框架下。在7个具有挑战性的搜索增强问答基准上的实验表明,在相同的展开预算约束下,IGRPO始终优于强基线,验证了利用诱导的教师分布指导长视界搜索智能体策略优化的有效性。  

## 1 引言  

大语言模型[2 (https://arxiv.org/html/2607.06223#bib.bib29),3 (https://arxiv.org/html/2607.06223#bib.bib30),26 (https://arxiv.org/html/2607.06223#bib.bib31)]日益被训练为通过与外部工具的多轮交互来解决问题的智能体[34 (https://arxiv.org/html/2607.06223#bib.bib32),20 (https://arxiv.org/html/2607.06223#bib.bib33),36 (https://arxiv.org/html/2607.06223#bib.bib35),10 (https://arxiv.org/html/2607.06223#bib.bib36)]。在搜索增强问答[30 (https://arxiv.org/html/2607.06223#bib.bib38),15 (https://arxiv.org/html/2607.06223#bib.bib37),12 (https://arxiv.org/html/2607.06223#bib.bib3)]中,智能体必须决定思考什么、何时发出检索查询、如何使用返回的证据,以及最终何时回答。该设置的一个核心困难是,智能体必须在许多可能的中间搜索状态之间分配有限的交互预算。因此,有效的训练不仅需要为完成的轨迹分配信用,还需要决定展开计算应该花费在何处。  

强化学习已被广泛用于通过优化交互轨迹来改进此类智能体[19 (https://arxiv.org/html/2607.06223#bib.bib34)]。现有基于结果的方法通常使用最终正确性奖励优化完整轨迹[21 (https://arxiv.org/html/2607.06223#bib.bib2),17 (https://arxiv.org/html/2607.06223#bib.bib22)],而基于群体的变体如GRPO[22 (https://arxiv.org/html/2607.06223#bib.bib1)]通过比较同一问题的多个展开,进一步避免了学习到的评论家。最近的研究尝试从两个互补方向改进长视界智能体训练:更细粒度的信用分配和更广泛的探索。基于链的方法如GiGPO[7 (https://arxiv.org/html/2607.06223#bib.bib6)]和IGPO[28 (https://arxiv.org/html/2607.06223#bib.bib7)]通过引入针对中间决策的轮次级学习信号,超越了纯粹的结果级学习。基于树的方法如Tree-GRPO[11 (https://arxiv.org/html/2607.06223#bib.bib10)]和AEPO[4 (https://arxiv.org/html/2607.06223#bib.bib28)]将展开生成从单个链条扩展到分支搜索过程,通过随机分支或启发式硬阈值扩展规则探索替代延续。这两条工作线共同表明,中间状态对于训练搜索智能体至关重要。  

参见图注  

图1:不同展开模式的图示。红色节点代表无望甚至误导性的状态,绿色节点代表信息丰富的状态,灰色节点代表其他中间状态。  
左:基于链的方法和现有的基于树的方法都可能将探索预算分配到无望节点上。  
右:我们的方法采用基于信息增益的展开分配,优先扩展信息丰富的节点,减少对无望分支的探索。  

然而,现有方法仍然留下了一个基本的计算分配问题未解决。中间状态在下游效用上可能有很大差异,但展开预算的分配通常没有明确估计这种效用。基于链的方法可能会将完整的轨迹花费在已经无望的前缀上。基于树的方法通过分支改进了探索,但其启发式或不确定性驱动的扩展规则仍可能将分支分配到无望的延续上。此外,这些方法通常将中间节点视为扩展目标,而不是明确评估它们是否为最终答案提供有用的证据。结果,训练可能会将计算浪费在低价值甚至误导性的前缀上,同时欠探索包含对回答问题有用证据的状态。这一限制既出现在基于链的展开中也出现在现有的基于树的展开中,如图1左侧所示。  

为了解决这个问题,我们提出**基于信息增益的展开策略优化**(IGRPO),这是一种将中间状态信息量作为展开收集核心组织原则的策略优化框架。我们在操作意义上使用“信息增益”指代*答案似然信息增益*:在到达中间搜索状态后,策略对真实答案的归一化似然的增加。IGRPO不是将搜索预算均匀地分配给活动分支,而是将信息增益派生的信息量视为软扩展潜力。在每个展开阶段,具有较大信息量的活动前缀被选为扩展的概率更高,而低信息量的前缀被采样的频率较低,从而消耗更少的计算。这诱导了一个预算感知的树结构展开过程,更好地适应了长视界搜索的需求(见图1右侧)。此外,我们的理论分析表明,这种基于信息增益的展开会诱导出一个限制性教师分布,显式地将采样偏向信息更丰富的轨迹。这反过来提供了一个清晰的策略优化目标,使策略能够向诱导的分布训练。通过这种方式,IGRPO将自适应树结构展开收集与策略优化统一在单个框架中,用于搜索密集型LLM智能体。在7个具有挑战性的搜索增强问答基准上的广泛实验表明,IGRPO始终优于强基线,在相同的展开预算约束下实现了更强的性能。  

我们的主要贡献总结如下:  
- • 我们为搜索密集型LLM智能体引入了一种基于信息增益的树展开策略。我们的方法自适应地将展开预算分配给信息更丰富的中间状态,减少在展开收集过程中对无望分支的不必要探索。  
- • 我们对基于信息增益展开下诱导的限制性分布进行了理论刻画。这一刻画表明,展开过程自然定义了一个教师分布,该分布作为策略学习的清晰优化目标。  
- • 我们在多个具有挑战性的搜索增强问答基准上展示了IGRPO始终优于强基线。平均而言,在3B骨干网络上,IGRPO比最强基线提高3.1%;在7B骨干网络上提高0.9%。  

## 2 相关工作  

#### 大语言模型的强化学习。  
强化学习(RL)最近已成为增强大语言模型(LLM)推理和决策能力的核心范式[8 (https://arxiv.org/html/2607.06223#bib.bib21),17 (https://arxiv.org/html/2607.06223#bib.bib22)]。早期的后训练方法如PPO[21 (https://arxiv.org/html/2607.06223#bib.bib2)]建立了用于对齐生成行为的标准策略优化框架,而较新的无评论家方法,包括GRPO[22 (https://arxiv.org/html/2607.06223#bib.bib1)]、RLOO[1 (https://arxiv.org/html/2607.06223#bib.bib23)]、DAPO[35 (https://arxiv.org/html/2607.06223#bib.bib24)]和GSPO[37 (https://arxiv.org/html/2607.06223#bib.bib25)],通过避免显式价值函数并使用基于奖励的基线或群体归一化优势来估计策略梯度,提高了可扩展性。除了偏好对齐,RL也被广泛用于激发复杂的推理行为,其中模型必须在获得最终反馈前做出一系列中间决策。这一性质自然将基于RL的LLM训练与智能体任务联系起来,在这些任务中,模型需要在多轮中推理、行动并与外部环境交互。这些进展为将RL应用于搜索密集型LLM智能体奠定了基础。  

#### 搜索密集型LLM智能体的强化学习。  
在这些进展的基础上,越来越多的工作将RL应用于基于搜索的LLM智能体。早期框架如Search-R1[12 (https://arxiv.org/html/2607.06223#bib.bib3)]训练模型在逐轮推理过程中自主发出搜索查询,并使用基于结果的奖励优化整个交互。ZeroSearch[25 (https://arxiv.org/html/2607.06223#bib.bib4)]进一步研究了如何在不直接依赖真实搜索引擎的情况下激励搜索行为。R1-Searcher[23 (https://arxiv.org/html/2607.06223#bib.bib26)]将搜索能力学习形式化为两阶段基于结果的RL问题,而Smart-Searcher[24 (https://arxiv.org/html/2607.06223#bib.bib27)]通过共同鼓励智能体利用内部参数知识和外部检索证据,进一步加强了动态知识获取。  

为了缓解多轮搜索中仅基于结果奖励的稀疏性,一些工作转向对中间决策进行更细粒度的监督。StepSearch[31 (https://arxiv.org/html/2607.06223#bib.bib5)]引入了带有更丰富中间证据利用奖励的逐轮PPO[21 (https://arxiv.org/html/2607.06223#bib.bib2)]。GiGPO[7 (https://arxiv.org/html/2607.06223#bib.bib6)]提出了一种基于锚点分组的RL框架,能够在保持基于组的优化稳定性的同时实现细粒度的信用分配。IGPO[28 (https://arxiv.org/html/2607.06223#bib.bib7)]进一步引入了信息增益作为内在的轮次级奖励,衡量每个交互轮次中答案置信度的边际改善。  

另一个方向将展开生成从单个链条扩展到分支搜索过程。Tree-GRPO[11 (https://arxiv.org/html/2607.06223#bib.bib10)]利用树结构展开和共享前缀,在固定交互预算下提高探索效率,而ARPO[5 (https://arxiv.org/html/2607.06223#bib.bib9)]和AEPO[4 (https://arxiv.org/html/2607.06223#bib.bib28)]引入了熵引导的展开,在不确定的工具使用轮次处选择性地进行分支。这些方法凸显了在智能体训练中利用中间状态的重要性。  

尽管取得了这些进展,现有方法在分配展开计算时并未明确考虑中间状态的实际效用,因此可能在无望的轨迹上浪费大量预算。我们的IGRPO通过引入一种基于信息增益、预算感知的展开框架来解决这个问题,该框架在采样时优先考虑信息更丰富的状态,同时为策略优化提供清晰的目标。  

## 3 预备知识  

### 3.1 问题设置  

令D=\{\(q,a\)\}表示问答对数据集,其中q是问题,a是真实答案。我们考虑一个配备外部检索工具的环境,记作S,该工具接受文本查询并返回一组检索结果,如摘要和文档。智能体的目标是通过与S在有限搜索预算下交互来解决问题q,并最终产生答案a^。对于每个问题q,智能体生成一个搜索展开o=\(τ1,τ2,...,τT\),其中T表示总轮次数,每个τi是一个特定的交互轮次。最后一轮τT是答案轮次,在[ans]步骤中输出最终预测a^,而之前的每一轮对应一个搜索轮次。特别地,对于t<T,每个τt由推理步骤(用[thk]表示)和工具使用步骤(用[sea]表示)组成;当有足够的信心回答问题并且智能体切换到答案步骤时,搜索轮次结束。整个过程在达到最大回答长度或收到停止符时终止。  

### 3.2 信息增益  

我们遵循IGPO[28 (https://arxiv.org/html/2607.06223#bib.bib7)]中信息增益的定义,将其视为衡量模型在特定中间状态下对问题答案信念的边际改善。设πθ为当前策略,对于问题q,模型在对给定中间历史h进行推理时产生一个词序列。令Pθ(a|h)表示在历史h后模型输出真实答案a的归一化似然。那么,从历史h到历史h′(表示一个额外搜索轮次后的新历史)的信息增益定义为:  
IG(h→h′) = Pθ(a|h′) − Pθ(a|h)  
直观上,信息增益量化了模型中搜索证据的额外效用:正的IG表示搜索轮次提供了支持性证据,负的IG表示检索结果可能误导了模型偏离正确答案,而零IG表示答案置信度没有变化。  

## 4 方法  

在本节中,我们提出基于信息增益的展开策略优化(IGRPO),该方法利用中间状态的信息量来指导展开收集和策略学习。我们首先介绍如何从展开中计算信息增益信号,然后描述预算感知的树结构展开过程,最后推导出由信息增益引导的展开所诱导的教师分布,并展示如何在策略优化中利用该分布。  

### 4.1 信息增益计算  

对于给定的中间历史h,我们需要一个有效的信号来评估其信息量。不出所料,我们使用答案似然信息增益作为基础信号,但在实际设置中,真实答案a是未知的。为了解决这个问题,我们采用与IGPO[28 (https://arxiv.org/html/2607.06223#bib.bib7)]类似的策略:将策略在当前状态下的最高概率答案作为代理真实标签。具体来说,对于历史h,我们定义:  
ã(h) = argmaxa Pθ(a|h)  
然后将信息增益近似为:  
IG̃(h→h′) = Pθ(ã(h′)|h′) − Pθ(ã(h)|h)  
为了确保计算稳健性,我们仅当代理答案一致时才使用此近似,并在推理步骤结束时应用该度量。  

为了获得每个节点可比较的值,我们引入节点值函数val(h),它聚合了该节点所有后续分支的信息。  

(注意:原文在“3.2 信息增益”之后是“4 方法”,但用户提供的文本中“3.2”后面直接是“4 方法”的部分内容。我们根据用户提供的文本继续翻译。用户提供的文本在“3.2”之后是“4.1 信息增益计算”和“Rollout Framework”等内容,但“Rollout Framework”似乎属于4.2节。我们按给定文本翻译,注意结构。)  

#### 展开框架。  
接下来,我们利用信息增益在固定搜索预算下构建展开轨迹。对于每个问题q,我们初始化一个搜索树,根节点为历史h0,仅包含问题q,并定义初始活动节点集为A0=\{h0\},其中活动节点指仍可进一步扩展的中间节点。在第i个扩展阶段,令Ai为当前活动节点集。我们不是将展开预算均匀分配给所有活动节点,而是根据它们的相对信息量进行分配。具体来说,对于每个节点h∈Ai,我们分配一个扩展概率:  
pi(h) = exp(γ·val(h)) / ∑_{h′∈Ai} exp(γ·val(h′))   (5)  
其中val(·)可以是任何基于信息增益的信号,γ是控制分配偏向较大值节点的程度的温度参数。给定阶段预算Bi,我们根据(5)中的分配概率独立地从Ai中采样Bi个活动节点,并在冻结策略下扩展每个选中的节点。由此产生的中间节点构成下一个活动集Ai+1,而终端节点根据其最终预测答案获得奖励,并记录为完成的展开终点。这个过程重复进行,直到活动集为空或达到最大交互轮次。  

我们展开框架的一个关键区别在于,分支不是由硬阈值决定的。相反,扩展由概率分配控制,该分配将计算软性地偏向信息量更高的节点。因此,包含更多信息中间节

(注意:用户提供的文本在“展开框架”之后中断,但我们需要完成整个翻译。由于用户只提供了部分内容,我们只翻译所提供的部分。回复应仅包含翻译后的markdown文本,不添加额外解释。我们保持原文的markdown格式,包括LaTeX公式和链接。注意:原文中的公式符号如`exp⁡`可能包含特殊字符,我们保持原样。另外,注意用户提供的文本末尾有“节点”后加了一句“A key distinction...”但未完成。我们按截断处停止。我们只翻译提供的文本,不要补充。)基于信息增益的展开策略优化:面向多轮LLM智能体的自适应树结构展开方法  
来源:https://arxiv.org/html/2607.06223  

Yijun Zhang∗  Fan Xu∗  Jiaxin Ding†  Yule Xie  Shiqing Gao  Xin Ding  
Haoxiang Zhang  Luoyi Fu  Xinbing Wang  
上海交通大学  
∗同等贡献。†通讯作者。  

###### 摘要  

强化学习已成为改善大语言模型(LLM)智能体在长视界搜索任务上的有效范式,在此类任务中,智能体需要在获得最终结果前做出一系列中间决策。然而,现有方法仍面临一个关键局限:展开预算的分配通常没有明确评估中间状态的效用。因此,大量计算可能被浪费在低价值状态上,尽管不同分支的信息量可能差异巨大。在本文中,我们提出基于信息增益的展开策略优化(IGRPO),一种将中间状态信息量作为展开收集组织原则的策略优化框架。具体而言,IGRPO通过根据节点级信息量分配扩展预算,执行预算感知的树结构展开,使得信息更丰富的分支被更频繁地扩展,而无望的分支则被逐步抑制。我们进一步证明,基于信息增益的展开会诱导出一个显式的限制性教师分布,该分布自然提供了一个清晰的策略优化目标,从而将自适应树结构探索与有原则的策略学习统一在单个框架下。在7个具有挑战性的搜索增强问答基准上的实验表明,在相同的展开预算约束下,IGRPO始终优于强基线,验证了利用诱导的教师分布指导长视界搜索智能体策略优化的有效性。  

## 1 引言  

大语言模型[2 (https://arxiv.org/html/2607.06223#bib.bib29),3 (https://arxiv.org/html/2607.06223#bib.bib30),26 (https://arxiv.org/html/2607.06223#bib.bib31)]日益被训练为通过与外部工具的多轮交互来解决问题的智能体[34 (https://arxiv.org/html/2607.06223#bib.bib32),20 (https://arxiv.org/html/2607.06223#bib.bib33),36 (https://arxiv.org/html/2607.06223#bib.bib35),10 (https://arxiv.org/html/2607.06223#bib.bib36)]。在搜索增强问答[30 (https://arxiv.org/html/2607.06223#bib.bib38),15 (https://arxiv.org/html/2607.06223#bib.bib37),12 (https://arxiv.org/html/2607.06223#bib.bib3)]中,智能体必须决定思考什么、何时发出检索查询、如何使用返回的证据,以及最终何时回答。该设置的一个核心困难是,智能体必须在许多可能的中间搜索状态之间分配有限的交互预算。因此,有效的训练不仅需要为完成的轨迹分配信用,还需要决定展开计算应该花费在何处。  

强化学习已被广泛用于通过优化交互轨迹来改进此类智能体[19 (https://arxiv.org/html/2607.06223#bib.bib34)]。现有基于结果的方法通常使用最终正确性奖励优化完整轨迹[21 (https://arxiv.org/html/2607.06223#bib.bib2),17 (https://arxiv.org/html/2607.06223#bib.bib22)],而基于群体的变体如GRPO[22 (https://arxiv.org/html/2607.06223#bib.bib1)]通过比较同一问题的多个展开,进一步避免了学习到的评论家。最近的研究尝试从两个互补方向改进长视界智能体训练:更细粒度的信用分配和更广泛的探索。基于链的方法如GiGPO[7 (https://arxiv.org/html/2607.06223#bib.bib6)]和IGPO[28 (https://arxiv.org/html/2607.06223#bib.bib7)]通过引入针对中间决策的轮次级学习信号,超越了纯粹的结果级学习。基于树的方法如Tree-GRPO[11 (https://arxiv.org/html/2607.06223#bib.bib10)]和AEPO[4 (https://arxiv.org/html/2607.06223#bib.bib28)]将展开生成从单个链条扩展到分支搜索过程,通过随机分支或启发式硬阈值扩展规则探索替代延续。这两条工作线共同表明,中间状态对于训练搜索智能体至关重要。  

参见图注  

图1:不同展开模式的图示。红色节点代表无望甚至误导性的状态,绿色节点代表信息丰富的状态,灰色节点代表其他中间状态。  
左:基于链的方法和现有的基于树的方法都可能将探索预算分配到无望节点上。  
右:我们的方法采用基于信息增益的展开分配,优先扩展信息丰富的节点,减少对无望分支的探索。  

然而,现有方法仍然留下了一个基本的计算分配问题未解决。中间状态在下游效用上可能有很大差异,但展开预算的分配通常没有明确估计这种效用。基于链的方法可能会将完整的轨迹花费在已经无望的前缀上。基于树的方法通过分支改进了探索,但其启发式或不确定性驱动的扩展规则仍可能将分支分配到无望的延续上。此外,这些方法通常将中间节点视为扩展目标,而不是明确评估它们是否为最终答案提供有用的证据。结果,训练可能会将计算浪费在低价值甚至误导性的前缀上,同时欠探索包含对回答问题有用证据的状态。这一限制既出现在基于链的展开中也出现在现有的基于树的展开中,如图1左侧所示。  

为了解决这个问题,我们提出**基于信息增益的展开策略优化**(IGRPO),这是一种将中间状态信息量作为展开收集核心组织原则的策略优化框架。我们在操作意义上使用“信息增益”指代*答案似然信息增益*:在到达中间搜索状态后,策略对真实答案的归一化似然的增加。IGRPO不是将搜索预算均匀分配给活动分支,而是将信息增益派生的信息量视为软扩展潜力。在每个展开阶段,具有较大信息量的活动前缀被选为扩展的概率更高,而低信息量的前缀被采样的频率较低,从而消耗更少的计算。这诱导了一个预算感知的树结构展开过程,更好地适应了长视界搜索的需求(见图1右侧)。此外,我们的理论分析表明,这种基于信息增益的展开会诱导出一个限制性教师分布,显式地将采样偏向信息更丰富的轨迹。这反过来提供了一个清晰的策略优化目标,使策略能够向诱导的分布训练。通过这种方式,IGRPO将自适应树结构展开收集与策略优化统一在单个框架中,用于搜索密集型LLM智能体。在7个具有挑战性的搜索增强问答基准上的广泛实验表明,IGRPO始终优于强基线,在相同的展开预算约束下实现了更强的性能。  

我们的主要贡献总结如下:  
- • 我们为搜索密集型LLM智能体引入了一种基于信息增益的树展开策略。我们的方法自适应地将展开预算分配给信息更丰富的中间状态,减少在展开收集过程中对无望分支的不必要探索。  
- • 我们对基于信息增益展开下诱导的限制性分布进行了理论刻画。这一刻画表明,展开过程自然定义了一个教师分布,该分布作为策略学习的清晰优化目标。  
- • 我们在多个具有挑战性的搜索增强问答基准上展示了IGRPO始终优于强基线。平均而言,在3B骨干网络上,IGRPO比最强基线提高3.1%;在7B骨干网络上提高0.9%。  

## 2 相关工作  

#### 大语言模型的强化学习。  
强化学习(RL)最近已成为增强大语言模型(LLM)推理和决策能力的核心范式[8 (https://arxiv.org/html/2607.06223#bib.bib21),17 (https://arxiv.org/html/2607.06223#bib.bib22)]。早期的后训练方法如PPO[21 (https://arxiv.org/html/2607.06223#bib.bib2)]建立了用于对齐生成行为的标准策略优化框架,而较新的无评论家方法,包括GRPO[22 (https://arxiv.org/html/2607.06223#bib.bib1)]、RLOO[1 (https://arxiv.org/html/2607.06223#bib.bib23)]、DAPO[35 (https://arxiv.org/html/2607.06223#bib.bib24)]和GSPO[37 (https://arxiv.org/html/2607.06223#bib.bib25)],通过避免显式价值函数并使用基于奖励的基线或群体归一化优势来估计策略梯度,提高了可扩展性。除了偏好对齐,RL也被广泛用于激发复杂的推理行为,其中模型必须在获得最终反馈前做出一系列中间决策。这一性质自然将基于RL的LLM训练与智能体任务联系起来,在这些任务中,模型需要在多轮中推理、行动并与外部环境交互。这些进展为将RL应用于搜索密集型LLM智能体奠定了基础。  

#### 搜索密集型LLM智能体的强化学习。  
在这些进展的基础上,越来越多的工作将RL应用于基于搜索的LLM智能体。早期框架如Search-R1[12 (https://arxiv.org/html/2607.06223#bib.bib3)]训练模型在逐轮推理过程中自主发出搜索查询,并使用基于结果的奖励优化整个交互。ZeroSearch[25 (https://arxiv.org/html/2607.06223#bib.bib4)]进一步研究了如何在不直接依赖真实搜索引擎的情况下激励搜索行为。R1-Searcher[23 (https://arxiv.org/html/2607.06223#bib.bib26)]将搜索能力学习形式化为两阶段基于结果的RL问题,而Smart-Searcher[24 (https://arxiv.org/html/2607.06223#bib.bib27)]通过共同鼓励智能体利用内部参数知识和外部检索证据,进一步加强了动态知识获取。  

为了缓解多轮搜索中仅基于结果奖励的稀疏性,一些工作转向对中间决策进行更细粒度的监督。StepSearch[31 (https://arxiv.org/html/2607.06223#bib.bib5)]引入了带有更丰富中间证据利用奖励的逐轮PPO[21 (https://arxiv.org/html/2607.06223#bib.bib2)]。GiGPO[7 (https://arxiv.org/html/2607.06223#bib.bib6)]提出了一种基于锚点分组的RL框架,能够在保持基于组的优化稳定性的同时实现细粒度的信用分配。IGPO[28 (https://arxiv.org/html/2607.06223#bib.bib7)]进一步引入了信息增益作为内在的轮次级奖励,衡量每个交互轮次中答案置信度的边际改善。  

另一个方向将展开生成从单个链条扩展到分支搜索过程。Tree-GRPO[11 (https://arxiv.org/html/2607.06223#bib.bib10)]利用树结构展开和共享前缀,在固定交互预算下提高探索效率,而ARPO[5 (https://arxiv.org/html/2607.06223#bib.bib9)]和AEPO[4 (https://arxiv.org/html/2607.06223#bib.bib28)]引入了熵引导的展开,在不确定的工具使用轮次处选择性地进行分支。这些方法凸显了在智能体训练中利用中间状态的重要性。  

尽管取得了这些进展,现有方法在分配展开计算时并未明确考虑中间状态的实际效用,因此可能在无望的轨迹上浪费大量预算。我们的IGRPO通过引入一种基于信息增益、预算感知的展开框架来解决这个问题,该框架在采样时优先考虑信息更丰富的状态,同时为策略优化提供清晰的目标。  

## 3 预备知识  

### 3.1 问题设置  

令D=\{\(q,a\)\}表示问答对数据集,其中q是问题,a是真实答案。我们考虑一个配备外部检索工具的环境,记作S,该工具接受文本查询并返回一组检索结果,如摘要和文档。智能体的目标是通过与S在有限搜索预算下交互来解决问题q,并最终产生答案a^。对于每个问题q,智能体生成一个搜索展开o=\(τ1,τ2,...,τT\),其中T表示总轮次数,每个τi是一个特定的交互轮次。最后一轮τT是答案轮次,在[ans]步骤中输出最终预测a^,而之前的每一轮对应一个搜索轮次。特别地,对于t<T,每个τt由推理步骤(用[thk]表示)和工具使用步骤(用[sea]表示)组成;当有足够的信心回答问题并且智能体切换到答案步骤时,搜索轮次结束。整个过程在达到最大回答长度或收到停止符时终止。  

### 3.2 信息增益  

我们遵循IGPO[28 (https://arxiv.org/html/2607.06223#bib.bib7)]中信息增益的定义,将其视为衡量模型在特定中间状态下对问题答案信念的边际改善。设πθ为当前策略,对于问题q,模型在对给定中间历史h进行推理时产生一个词序列。令Pθ(a|h)表示在历史h后模型输出真实答案a的归一化似然。那么,从历史h到历史h′(表示一个额外搜索轮次后的新历史)的信息增益定义为:  
IG(h→h′) = Pθ(a|h′) − Pθ(a|h)  
直观上,信息增益量化了模型中搜索证据的额外效用:正的IG表示搜索轮次提供了支持性证据,负的IG表示检索结果可能误导了模型偏离正确答案,而零IG表示答案置信度没有变化。  

## 4 方法  

在本节中,我们提出基于信息增益的展开策略优化(IGRPO),该方法利用中间状态的信息量来指导展开收集和策略学习。我们首先介绍如何从展开中计算信息增益信号,然后描述预算感知的树结构展开过程,最后推导出由信息增益引导的展开所诱导的教师分布,并展示如何在策略优化中利用该分布。  

### 4.1 信息增益计算  

对于给定的中间历史h,我们需要一个有效的信号来评估其信息量。不出所料,我们使用答案似然信息增益作为基础信号,但在实际设置中,真实答案a是未知的。为了解决这个问题,我们采用与IGPO[28 (https://arxiv.org/html/2607.06223#bib.bib7)]类似的策略:将策略在当前状态下的最高概率答案作为代理真实标签。具体来说,对于历史h,我们定义:  
ã(h) = argmaxa Pθ(a|h)  
然后将信息增益近似为:  
IG̃(h→h′) = Pθ(ã(h′)|h′) − Pθ(ã(h)|h)  
为了确保计算稳健性,我们仅当代理答案一致时才使用此近似,并在推理步骤结束时应用该度量。  

为了获得每个节点可比较的值,我们引入节点值函数val(h),它聚合了该节点所有后续分支的信息。  

(注:原文在“4.1”之后是“Rollout Framework”,但用户提供的文本中该部分标题为“#### Rollout Framework.”,我们保持原样翻译。)  

#### 展开框架。  
接下来,我们利用信息增益在固定搜索预算下构建展开轨迹。对于每个问题q,我们初始化一个搜索树,根节点为历史h0,仅包含问题q,并定义初始活动节点集为A0=\{h0\},其中活动节点指仍可进一步扩展的中间节点。在第i个扩展阶段,令Ai为当前活动节点集。我们不是将展开预算均匀分配给所有活动节点,而是根据它们的相对信息量进行分配。具体来说,对于每个节点h∈Ai,我们分配一个扩展概率:  
pi(h) = exp(γ·val(h)) / ∑_{h′∈Ai} exp(γ·val(h′))   (5)  
其中val(·)可以是任何基于信息增益的信号,γ是控制分配偏向较大值节点的程度的温度参数。给定阶段预算Bi,我们根据(5)中的分配概率独立地从Ai中采样Bi个活动节点,并在冻结策略下扩展每个选中的节点。由此产生的中间节点构成下一个活动集Ai+1,而终端节点根据其最终预测答案获得奖励,并记录为完成的展开终点。这个过程重复进行,直到活动集为空或达到最大交互轮次。  

我们展开框架的一个关键区别在于,分支不是由硬阈值决定的。相反,扩展由概率分配控制,该分配将计算软性地偏向信息量更高的节点。因此,包含更多信息中间节  

(注意:用户提供的文本在“包含更多信息中间节”处中断。根据要求,我们只翻译所提供的文本,不补充或修改。因此翻译到此结束。)

相似文章

过程奖励引导的树状展开实现高效多轮强化学习

arXiv cs.CL

提出PaTR,一个过程奖励引导的自适应树状展开框架,用于LLM智能体的多轮强化学习。它选择性地从有希望的中间状态进行分支,并剪枝死胡同路径,在相同训练预算下,在SWE-Bench上最高提升+5.0,在FrozenLake上提升+9.3。

面向进度与可靠性的智能体强化学习组策略优化

arXiv cs.AI

ProGPO是一种免学习评论器的方法,用于LLM智能体基于组的RL中的步骤级优势估计,它使用精确前缀动作比较和基于rollout的状态势,以改善长视界任务上的信用分配。在ALFWorld和WebShop上使用Qwen2.5模型的实验表明,它优于现有的智能体RL基线。