向量策略优化:面向多样性的训练提升测试时搜索性能
摘要
本文介绍了一种名为向量策略优化(Vector Policy Optimization, VPO)的强化学习算法,该算法通过优化多个奖励维度来训练大语言模型生成多样化的解决方案,与标量强化学习基线相比,显著提升了测试时搜索性能。
语言模型现在必须能够开箱即用地泛化到新环境,并在推理时扩展搜索流程(如AlphaEvolve)中发挥作用,这些流程通过多种任务特定的奖励函数来选择生成结果。不幸的是,大语言模型后训练的标准范式是优化预先指定的标量奖励,这常常导致当前的大语言模型产生低熵的响应分布,从而难以展现推理时搜索所需的多样性。我们提出了向量策略优化(Vector Policy Optimization, VPO),这是一种强化学习算法,显式地训练策略以预期多样化的下游奖励函数并生成多样化的解决方案。VPO利用了奖励在实际中通常是向量值的事实,例如代码生成中的每个测试用例的正确性,或者多个不同的用户角色或奖励模型。VPO本质上是GRPO优势估计器的即插即用替代品,但它训练大语言模型输出一组解决方案,其中每个解决方案专门针对向量奖励空间中的不同权衡。在四个任务上,VPO在测试时搜索(例如pass@k和best@k)中与最强的标量强化学习基线相当或更优,且随着搜索预算的增加,差距进一步扩大。对于进化搜索,VPO模型解锁了GRPO模型根本无法解决的问题。随着测试时搜索变得越来越标准化,面向多样性的优化可能需要成为默认的后训练目标。
查看缓存全文
缓存时间: 2026/05/22 19:47
# 面向多样性的训练提升测试时搜索性能
**来源:** https://arxiv.org/html/2605.22817
## 向量策略优化:面向多样性的训练提升测试时搜索性能
**作者:** Ryan Bahlous-Boldi¹,²、Isha Puri¹、Idan Shenfeld¹,²、Akarsh Kumar¹、Mehul Damani¹、Sebastian Risi⁴、Omar Khattab¹、Zhang-Wei Hong¹,²,³、Pulkit Agrawal¹,²
¹MIT、²Improbable AI Lab、³MIT-IBM Computing Research Lab、⁴Sakana AI
###### 摘要
语言模型现在必须能够开箱即用地泛化到新环境,并在推理-缩放搜索流程(如AlphaEvolve)中工作,这类流程会利用多种特定于任务的奖励函数来选择生成结果。不幸的是,LLM后训练的标准化范式优化的是一个预先指定的标量奖励,这常常导致当前的LLM产生低熵的响应分布,从而难以展现推理时搜索所需的多样性。我们提出了**向量策略优化(VPO)**,这是一种强化学习算法,它专门训练策略以预测多样化的下游奖励函数,并产生多样化的解决方案。VPO利用了实践中奖励通常是向量值这一事实,例如代码生成中每个测试用例的正确性,或不同的用户角色或奖励模型。VPO本质上是GRPO优势估计器的即插即用替代方案,但它训练LLM输出一组解决方案,其中单个解决方案专门处理向量奖励空间中的不同权衡。在四个任务上,VPO在测试时搜索(例如pass@k和best@k)上匹配或击败了最强的标量RL基线,并且随着搜索预算的增加,差距也在扩大。对于进化搜索,VPO模型解锁了GRPO模型根本无法解决的问题。随着测试时搜索变得越来越标准化,为多样性优化可能需要成为默认的后训练目标。
请参阅图注
**图1:向量策略优化(VPO)。** 在最大化标量时,GRPO将所有解决方案推向同一个、可能次优的解。VPO同时针对不同的奖励权重进行优化,增加了找到更优目标解的机会。因此,例如在LiveCodeBench上,无论使用pass@k还是像AlphaEvolve这样复杂的进化测试时搜索,VPO都能带来更好的测试时搜索性能。
## 1 引言
探索是强化学习(RL)中的核心原则。为了让学习持续进步,智能体必须保持多样化的行为,尝试不同的策略,而不是过早地固守单一策略。在经典RL(Sutton和Barto,1998;Bellemare等人,2016;Pathak等人,2017)和现代基础模型(Chen等人,2025;Setlur等人,2025;Qu等人,2026;Hong等人,2024)的背景下,探索与利用之间的平衡(Ladosz等人,2022)都得到了深入研究。尤其对于基础模型而言,这种权衡仍然是一个很大程度上未解决的问题。在许多AI系统中,网络只是更大流程中的一个组件。尤其对于难题,语言模型通常会以某种搜索形式被封装,从简单的使用验证器进行拒绝采样(Cobbe等人,2021;Brown等人,2024)到像AlphaEvolve(Novikov等人,2025;Lange等人,2025)这样复杂的进化方法。在这些设置中,测试时搜索负责利用,这暗示训练应专注于为搜索提供一个**丰富且多样化的解决方案池**以供选择。
然而,现有的RL后训练方法并不适合这种多样性保持。像GRPO(Shao等人,2024)这样的策略梯度方法会将策略推向一组狭窄的高概率响应(Wu和Choi,2025;Yue等人,2025)。训练后,有效测试时搜索所需的多样性消失了,因为额外的样本变成了近乎重复的样本(GX-Chen等人,2025;Kirk等人,2024;Karouzos等人,2026)。在这项工作中,我们提出了一种视角的转变。我们不是让单一的训练算法同时处理探索和利用,而是通过假设未来存在测试时利用阶段,将这两个职责完全分开。
> **在这种设置下,RL后训练的作用不应是收敛到一个单一的最佳响应,而是最大化一组有能力的解决方案的多样性。** 随后在测试时,搜索方法将从这些方案中选择。
为了训练一个能产生多样且有能力解决方案的策略,我们利用了在许多现实任务中奖励可以自然地分解成一个组件向量这一事实:代码生成中每个测试用例的正确性,RLHF中每个标准的评分,或者多跳推理中每个子问题的成功。这种分解为多样性提供了一个自然的轴。我们不是将这些组件合并成一个单一的标量并朝着一个峰值优化,而是可以鼓励模型产生在不同奖励维度上表现出色的解决方案,覆盖帕累托前沿,而不是收敛到其上的一个点(Roijers等人,2013)。我们将这种优化方案称为**向量策略优化(VPO)**。
具体来说,VPO将多答案生成(Puri等人,2026)与随机奖励标量化相结合,训练模型生成覆盖帕累托前沿而非坍缩到单一点的候选集。这些机制共同维持了一个更丰富的候选分布,使得测试时搜索能够随着样本预算的增长而提取出越来越好的解决方案。我们在四个不同的设置中评估了VPO,涵盖多跳问答、逻辑推理、导航、工具使用和编码。实验表明,在我们的四个基准测试中,VPO在测试时best@k上与最强的标量基线相比,匹配或超越了它们,并且随着候选预算的增加,差距在扩大。这种优势在更大规模上依然成立:在LiveCodeBench上,一个VPO训练的Qwen2.5-Coder-7B-Instruct在pass@k和best@k上都优于同等计算量的GRPO检查点,并且在OpenEvolve搜索循环内,解锁了GRPO在任何候选预算下都无法解决的问题(图1)。
我们的主要贡献是:
- • 我们认为在具备测试时搜索的AI系统中,RL后训练应完全专注于产生多样化且有能力的解决方案,将利用的任务交给搜索。
- • 我们展示了在许多实际设置中奖励的向量值结构为实现这种多样性提供了一种自然机制,即训练模型覆盖不同目标的帕累托前沿。
- • 我们提出了向量策略优化(VPO),这是该思想的一个具体实例化,它结合了随机奖励标量化与语言模型的上下文能力,以在单次生成中产生多样化的候选集。
## 2 我们追求的是哪种多样性?
#### 动机
下游的搜索过程只有当候选方案在搜索所需的具体轴上有所不同时,才能从中受益。表面层面的变化、语义多样性或噪声采样是不够的。搜索需要一个候选池,这些候选方案实现了任务基础目标之间不同的高质量权衡。一旦语言模型被部署到搜索增强的系统中,这一点就变得重要起来。在推理时,模型不再是一次评估一个响应。相反,系统会生成多个候选解决方案并在其中进行选择。在这种机制下,将整个策略固守在一个单一的权衡上是不必要的限制。目标不再是产生一个在单一固定目标下最优的响应,而是产生一组**跨越多个合理权衡的响应**,以便下游搜索能够在其中进行选择。我们称这种属性为**奖励多样性**。一个奖励多样化的候选池包含的解决方案在每个解决方案都在潜在奖励组件的不同权重下达到最优。直观地说,该策略故意保持不承诺:它不是坍缩到单个模式,而是保留了在不同偏好下表现良好的多种策略。
#### 设置
令x表示提示,y表示从策略π_θ(·|x)中采样的响应。在许多实际任务中,奖励信号自然地分解成d个分量:r(x,y) = [r₁(x,y), ..., r_d(x,y)] ∈ ℝ^d,其中每个r_i捕捉响应质量的一个不同方面。例如,r_i可以是代码生成中每个测试用例的正确性(Chen等人,2021),RLHF中每个标准的偏好分数(Wang等人,2024),多跳推理中每个跳的正确性(Trivedi等人,2022),或智能体任务中每个工具调用的结构和内容分数(Qian等人,2025)。单纯形上的任何权重w∈Δ^{d-1}都会衍生出一个标量目标w^T r(x,y);标准的后训练固定一个单一的权重w*,并训练策略最大化E_{y∼π_θ(·|x)}[w*^T r(x,y)]。在标准的单响应框架下,这是合理的:如果策略只输出一个答案,并且评估使用已知的权重w*,那么直接优化w*是正确的目标。
一旦引入推理时搜索,情况就发生了变化。搜索恰恰受益于实现不同权衡的候选方案。仅针对w*训练的策略没有动机保持这样的替代方案,而策略梯度训练反而将概率质量集中到当前最大化标量奖励的任何策略上。额外的样本因此变得越来越冗余。关键在于,即使部署目标w*是事先已知的,保持这些替代方案也是有用的。原因是搜索操作的是候选方案的**集合**,而不是单个响应。一个涵盖多种奖励权衡的候选池为搜索过程提供了更多机会,以发现w*本身下的高性能解决方案。在标量训练下,优化会激进地固守任何在当前w*下得分最高的响应。为了某一组件而牺牲另一组件的替代策略在早期就被抑制了,即使它们最终会在相同的最终目标下带来更强的解决方案。随着训练的进行,候选分布坍缩,额外的样本变得越来越冗余。
奖励多样性通过保留在奖励单纯形不同区域下最优的解决方案来对抗这种坍缩。这些解决方案中的许多在w*下可能看起来局部次优,但仍然包含最终在w*下产生更高分结果的部分推理模式、分解或策略。从这个意义上说,奖励多样性作为一种结构化的探索形式:策略不是过早地固守一个单一的权衡,而是维持一个有能力替代方案的种群足够长的时间,以便搜索能够利用它们。这种视角自然地与多目标强化学习(Roijers等人,2013;Hayes等人,2022)以及进化计算中的lexicase选择(Spector,2012;Spector等人,2024;La Cava等人,2019;Ni等人,2024)联系起来。两者都保留在不同子集或权重下的目标上最优的解决方案,而不是将所有标准合并成一个单一的聚合分数。然而,重要的是,我们的目标不同于经典的多目标优化。我们不是追求一个基于用户指定偏好条件的策略,也不假设部署目标未知。我们的目标仍然是在固定的权重w*下的性能。关键区别在于,在搜索增强的机制下,优化w*的最佳方式可能是训练一个保持奖励多样化候选集的策略,而不是立即坍缩到一个单一的最优解。
## 3 方法:向量策略优化
在第2节中,我们论证了正确的RL目标是奖励多样化的集合,即每个候选方案在奖励组件的某个权重下达到最优的集合。本节描述了我们提出的算法——**向量策略优化(VPO)**,它训练策略以产生这样的集合。VPO有两个关键组成部分。首先,我们训练模型在单个自回归生成过程内为每个提示生成多个候选完成项。其次,我们用权重分布替换固定的奖励权重,从而激励模型将其候选方案分布在子目标之间的不同权衡上。
请参阅图注
**图2:向量策略优化概述。** 给定一个提示x,模型π_θ在单个自回归链中输出m个答案。每个答案y_i在多个目标上进行评估,并获得一个得分向量[r₁, r₂, ..., r_n]。我们重复采样权重向量w_i∼Dir(1),并评估在答案集合中每个权重w下的平均best-of-m。这个集合级别的奖励被视为整个完成π_θ(x)的奖励。
总之,这些组件定义了一个集合级别的目标,奖励模型产生多样化、高质量的解决方案。下面我们详细描述每个组件。
### 3.1 多答案链作为上下文探索
遵循Puri等人(2026)的方法,我们训练语言模型在单次生成过程中产生一个有m个候选完成项的集合S={y₁, ..., y_m}。完成项按顺序发出,由分隔符标记隔开,因此在生成y_i时,前缀已经包含了y₁, ..., y_{i-1}。这从根本上改变了探索的本质。在标准的独立采样下,多样性仅来自应用于固定条件分布的随机解码,产生围绕策略集中到的任何模式的小幅变化。在多答案生成中,每个新的候选都可以关注已经发出的候选,使模型能够识别解空间的哪些区域已被覆盖,并引导后续候选转向不同的区域。多样性成为一种显式的上下文机制,而不是副产品。相似文章
@RyanBoldi: 您的 RL 后训练可能正在破坏您的 LLM 的测试时扩展!传统 RL 假装您可以将所有奖励信号压缩为...
介绍了向量策略优化(VPO),一种新的 RL 方法,通过处理向量值奖励来改进 LLM 的测试时扩展,优于传统的标量奖励方法。
@ishapuri101: 我一直觉得强化学习把所有奖励信号压缩成一个标量是不合理的。今天,我们解决了这个问题!引入向量策略优化…
引入向量策略优化(VPO),用于训练模型使用向量值奖励而非标量奖励,从而为测试时搜索生成多样化的答案集合。
列表式策略优化:基于分组的 RLVR 作为 LLM 响应单纯形上的目标投影
本文介绍了列表式策略优化(LPO),这是一种用于 RLVR 的方法,通过在响应单纯形上进行散度最小化来显式处理目标投影,从而提高大语言模型(LLM)的训练稳定性和性能。
PPO-HSC:一种基于广域策略覆盖优化的探索性强化学习框架
PPO-HSC引入了一种高阶采样覆盖奖励,以鼓励在LLM的强化学习微调中探索多样化的推理模式,从而在数学和代码任务上提升解决方案的多样性和状态空间覆盖。
近未来策略优化
提出近未来策略优化(NPO),一种混合策略强化学习方法,通过在同一训练运行中利用更晚的 checkpoint 学习,加速收敛,将 Qwen3-VL-8B-Instruct 性能从 57.88 提升至 62.84。