既然可以枚举,为何要采样?基因组工具选择的精确策略优化
摘要
论文提出了FGPO,这是一种基因组工具选择中的精确策略优化方法,通过枚举所有可能的工具子集来优于基于采样的方法如GRPO。
arXiv:2609.10221v2 公告类型:新
摘要:在冻结推理器上的强化学习已成为教导策略调用哪些外部工具的常见方法。我们表明,在专家科学设置中,当完整的工具子集空间可枚举时,这种方法会变得结构不匹配。在那里,一个小的重复计算能力集合覆盖了领域,因此工具子集空间是组合的但小到足以枚举,而GRPO仍然从少数采样运行中估计动作期望。更糟糕的是,随着训练成功,近似会退化:当策略集中在首选子集时,它会重新采样它们,采样奖励发生碰撞,组归一化优势消失。在基因组推理中,产生无奖励信号的问题比例从均匀参考策略下的0.2%上升到GRPO训练后的20.8%。作为补救措施,我们引入了FGPO(全组策略优化),它(1)对每个工具子集进行评分并优化精确动作期望,因此每次更新都看到完整的动作空间,以及(2)预计算每个问题-子集对的奖励到详尽的表格中,完全从训练循环中移除冻结推理器调用。在五个冻结推理器和三个基因组基准测试中,FGPO在所有15个设置中优于GRPO,平均高出6.75分,最高达14.20分,而标准按需GRPO调度将需要2.4倍的冻结推理器奖励评估,并且在GenomeQA上,FGPO将每个问题调用的工具从2.36减少到1.40。
查看缓存全文
缓存时间: 2026/09/11 08:44
# 当可枚举时为何采样?基因组工具选择的精确策略优化
来源:https://arxiv.org/html/2609.10221
**作者:**
- Haoyue Liu:香港中文大学(深圳)理工学院,深圳 518172,中国;深圳未来网络智能研究院(FNii-Shenzhen)
- Xiaoyu Ma:香港中文大学(深圳)理工学院,深圳 518172,中国
- Zhichao Wang:香港中文大学(深圳)理工学院,深圳 518172,中国
- Xiaoying Tang:香港中文大学(深圳)理工学院,深圳 518172,中国;深圳未来网络智能研究院(FNii-Shenzhen)
#### 摘要
基于冻结推理器的强化学习已成为训练策略选择外部工具的常见方法。我们表明,在工具子集空间完全可枚举的专业科学场景中,这种方法存在结构性失配。此类场景中,少量重复的计算能力即可覆盖领域,因此工具子集空间虽呈组合性质,但规模小到足以枚举,而 GRPO 仍通过少量采样滚动来估计动作期望。更糟的是,随着优化成功,这种近似会退化:策略集中于首选子集时会对其进行重采样,采样奖励发生碰撞,组归一化优势值消失。在基因组推理任务中,未获得奖励信号的问题比例从均匀参考策略下的 0.2% 上升到 GRPO 训练后的 20.8%。为解决此问题,我们提出 FGPO(全组策略优化):(1) 评分所有工具子集并优化精确的动作期望,使每次更新都能看到完整的动作空间;(2) 预计算每个问题-子集对的奖励为详尽表,完全移除训练循环中的冻结推理器调用。在五个冻结推理器和三个基因组基准测试中,FGPO 在所有 15 个设置中均优于 GRPO,平均提升 6.75 分,最高达 14.20 分;而标准按需 GRPO 方案需要 2.4 倍的冻结推理器奖励评估,在 GenomeQA 上,FGPO 将平均调用工具数从 2.36 降至 1.40。
## 1 引言
大语言模型可以解读专业科学问题,但无法可靠执行其中许多问题所需的精确计算。基因组推理就是一个典型例子:LLM 理解启动子、转录因子结合和剪接位点,但回答此类问题需要对原始核苷酸序列进行显式计算:如基序扫描、剪接位点评分和组成分析(Jin 等,2024)。外部工具恰好提供了这些能力,因此一系列卓有成效的工作训练策略来选择冻结推理器应接收的工具,并通过强化学习优化该策略:如用于视觉工具的 VisTA(Huang 等,2025)、用于音频工具的 AuTAgent(Tong 等,2026),以及奖励塑形变体(Qian 等,2026;Jin 等,2025),几乎总是使用 GRPO(Shao 等,2024)。
图 1:为何采样?当可枚举时?(a)在 3,590 个 GenomeQA 测试问题上使用单个工具、所有工具、无工具和问题级最优选择的结果;最优选择揭示了 38.1 分的可恢复差距。(b)所有 G 次滚动获得相同奖励的闭合形式概率,形成零奖励优势的*死组*。(c)当相同训练结构仅观察每次访问均匀采样的 k 个动作时的准确率。
尽管此方法在其他场景中成功,但在本文研究的专业领域中却存在不可避免的缺陷。由于领域复用少量重复能力,紧凑库即可覆盖;即使全局注册表较大,每个查询的活跃工具集也很小:在 BFCL 上,来自 370 个工具注册表的自适应短名单约 7 个工具(7.4±2.5)保留了 90.3% 的正确工具覆盖率,几乎与 50 个工具的 90.8% 匹配(Repantis 等,2026)。我们的四个基因组工具仅允许 2⁴=16 个子集,使得动作期望可精确计算,但 GRPO 仍通过采样滚动来近似它。在此规模下,选择确实至关重要。如图 1a 所示,冻结推理器在不使用工具时得分为 39.28%,而同一库上问题级最优选择达到 77.41%,留下了 38.1 分的可恢复差距——调用所有工具(49.39%)并未捕捉到此差距。但对该空间进行采样不仅是浪费:随着优化成功,其质量会下降。当采样奖励重合时,组对策略毫无教益,因为所有归一化优势均为零,而集中化的策略会重采样相同子集。图 1b 显示此*死组*率从均匀参考策略下的 0.2% 攀升至 GRPO 训练后的 20.8%,在使用差异奖励训练的 GRPO 下达到 79.6%;图 1c 显示随着优化器看到更广的动作空间,准确率单调上升。这引出了本文的核心问题:*当期望可精确计算时,为何要采样?* 作为解决方案,我们引入 FGPO(全组策略优化),这是一个针对可枚举工具选择空间的精确策略优化框架。FGPO 结合:(1) 一个精确目标,评分所有工具子集并优化完整动作期望,使每次更新能看到整个动作空间而非其样本;(2) 一个详尽奖励表,预先计算每个问题-子集对一次,完全移除训练循环中的冻结推理器调用。对于自回归 LLM 策略,我们进一步使用基于 token 的长度归一化候选评分和熵正则化来获得该目标的实用实现。我们的贡献总结如下:
- • 将工具增强的基因组推理表述为依赖查询的组合工具子集选择,并揭示了相对于无辅助推理器存在 38.1 分的每问题最优差距,证明了正确选择专业能力的重要性。
- • 发现了采样策略优化与可枚举工具选择空间之间的失配。在 GenomeQA 上,死组率在 GRPO 训练后从 0.2% 上升至 20.8%,在另外两个基准测试中类似地为 17.4–17.8%;受控的 k 子集实验进一步表明,当相同训练结构获得更广的均匀动作覆盖时,准确率单调提升。
- • 提出 FGPO,用所有可枚举工具子集上的精确优化替代采样优化。在五个推理器和三个基因组基准测试中,FGPO 在所有 15 个设置中均优于 GRPO,平均提升 6.75 分,最高达 14.20 分;而标准按需 GRPO 方案需要 2.4 倍的冻结推理器奖励评估,在 GenomeQA 上 FGPO 将平均调用工具数从 2.36 降至 1.40。
## 2 FGPO:可枚举工具子集上的精确策略优化
参见图例
图 2:FGPO 概览。一个可训练的 LoRA 策略为问题评分所有 2ⁿ 个工具子集;执行每个子集的工具,将其证据交给冻结推理器,将结果奖励预先计算一次为详尽表,进入精确目标 J(θ)=∑ₐ q_θ(a|s) r(s,a),使每个子集对每次更新都有贡献。采样替代方案则绘制 G 次滚动,在收敛时根据式 (1) 留下 20.8% 的问题仅有一个奖励类别(在采样基线更粗的奖励下为 79.6%),因此优势为零。
本节将 FGPO 发展为 LLM 工具选择的精确策略优化:在所有 2ⁿ 个工具子集上的目标(第 2.2 节)、其 LLM 实例化所需的两个选择以及受控的候选评分评估(第 2.3 节),以及预先计算 r(s,a) 一次的详尽奖励表(第 2.4 节)。附录 A 中的算法 1 说明了整个过程。
### 2.1 设置
令 D 表示训练问题分布。一个冻结推理器 R 回答来自 s~D 的多选基因组问题,可选地接收在问题序列上运行的工具子集 a⊆{T₁,...,Tₙ} 的输出。这些工具是对该序列的独立分析,不消耗另一个的输出,因此子集完全指定了执行。策略 q_θ(a|s)(其中 θ 为 LoRA 适配器的参数)选择子集;动作空间为 A=2^{T₁,...,Tₙ},|A|=2ⁿ(在所有主要实验中 n=4,即 16 个动作;表 1 列出了该库)。令 y★ 为正确选项,ŷ(s,a) 为推理器根据子集 a 证据给出的答案,奖励评估正确性并添加一个量级小十倍的简洁性平权:
r(s,a) = 2·𝟙[ŷ(s,a)=y★] - 1 ±1 + λ(1 - 2|a|/n),λ=0.10, (1)
因此正确性始终占主导,在对正确性达成一致的子集中,使用更少工具的得分更高。我们遵循 Tong 等 (2026) 的*设置*(冻结推理器、工具子集动作空间、RL 训练的选择器),但不采用其差异奖励(第 3.1 节)。策略是一个带有 LoRA 适配器(Hu 等,2021)的 7B LLM,它以短索引字符串形式输出子集,该字符串基于*匿名*工具槽,无工具名称或描述,因此其学习的任何路由都来自奖励而非文本(附录 G)。
### 2.2 精确目标
对于冻结的、贪婪解码的推理器,我们将 r(s,a) 视为有效确定性(独立的实时管道与缓存的差异在 0.05 分内,第 C 节)。策略梯度目标中的*动作*期望及其梯度因此是一个有限和,可精确计算;问题上的期望按常规进行小批量处理:
J(θ) = 𝔼_{s~D} ∑_{a∈A} q_θ(a|s) r(s,a),∇_θ J = 𝔼_s ∑_{a∈A} r(s,a) ∇_θ q_θ(a|s),(2)
当每次访问的 2ⁿ 个候选评估负担得起时,无需采样即可计算。FGPO 直接在工具子集空间上优化式 (2),关联到上下文老虎机设置中(Langford & Zhang, 2007)的期望和全动作策略梯度(Ciosek & Whiteson, 2020;Asadi 等,2017)。对比 GRPO(Shao 等,2024),后者从自回归生成策略中采样 G 次滚动。令 p_θ^gen(a|s) 表示该采样器诱导的解析工具子集上的分类分布;则 a₁,...,a_G ~ p_θ^gen(·|s),GRPO 在组归一化优势上步进,其中 r 是该臂训练的任何奖励,在我们的实验中为差异奖励(第 3.1 节):
Â_i = (r(s,a_i) - μ)/(σ + ε),μ = (1/G) ∑_{j=1}^G r(s,a_j),σ² = (1/G) ∑_{j=1}^G (r(s,a_j) - μ)²。(3)
其中 ε>0 用于数值稳定性。由此产生两个限制。每当 G 次抽取的奖励相同时,所有分子为零,因此无论 ε 如何,所有优势都消失,形成*死组*,第 3.4 节显示这达到均匀参考率的 104 倍–178 倍。并且由于组是从 p_θ^gen 本身抽取的,覆盖范围随着采样策略的集中而缩小,而这正是优化产生的结果。式 (2) 在无采样组的情况下评估每个子集:集中可以通过 q_θ 缩小奖励梯度,但采样不会遗漏任何动作(附录 F.1)。图 3 在实际数据上具体说明了这一点:收敛的 GRPO 策略将 98% 的质量放在单个子集上(面板 b),且每问题死概率严重偏斜(面板 c),因此采样在策略已承诺的地方恰好失明。
图 3:每个估计器所见。(a)相同状态下的两个估计器。(b)收敛 GRPO 策略导出的 16 个子集分布,针对一个 GenomeQA 问题;绿色标记正奖励。(c)在所有 3,590 个测试问题上 G=6 时的每问题死概率,奖励类别来自式 (1);平均值为 20.8%,如第 3.4 节报告。
### 2.3 LLM 策略上精确估计器的实例化
两个选择将式 (2) 与 LLM 策略上的实用方法分开,每个都由观察到的失败驱动;我们还使用受控的候选评分评估来比较在相同解码规则下训练的策略。
(i) 基于 token 的长度归一化。2ⁿ 个动作是 5–13 个 token 的字符串,空子集最短,因此原始序列对数概率上的 softmax 嵌入了一个偏向不调用任何东西的先验,而当动作是抽象索引时则不存在此偏差。令 y_a 为编码 a 的 token 字符串,π_θ 为策略的下一 token 分布,我们按其基于 token 的平均值评分候选。这里 q_θ 表示 FGPO 使用的候选归一化分类分布;它不同于 GRPO 采样器在式 (3) 中使用的生成诱导 p_θ^gen:
l_θ(a|s) = (1/|y_a|) ∑_{t=1}^{|y_a|} log π_θ(y_{a,t} | s, y_{a,<t})。
工具名称、描述以及任何“有助于”...相似文章
利用超组相对策略优化推动生物分子效用-多样性前沿
本文介绍了 SGRPO,这是一种策略优化框架,通过结合集合级多样性奖励和效用来提升生物分子的生成能力。它在小分子和蛋白质设计等任务中展示了改进的效用-多样性权衡。
F-GRPO: 分解式组相对策略优化用于统一候选生成与排序
F-GRPO 提出了一种分解式组相对策略优化框架,将候选生成与排序统一在单个自回归LLM中,解决了信用分配问题,并在序列推荐和多跳问答基准上提升了顶级性能。
群组自适应裁剪策略优化
本文提出群组自适应裁剪策略优化(GAPO),这是一种对GRPO方法的插件式修改,通过根据rollout优势自适应调整裁剪边界,在数学推理和编程基准测试中提升了Pass@1和Pass@k的表现。
组熵控制策略优化
本文提出组熵控制策略优化(GEPO),一种轻量级扩展GRPO的方法,利用组熵进行熵条件非对称优势塑造,解决了基于强化学习的大语言模型对齐过程中不同任务间的异质熵区域问题。实验表明,相比GRPO和近期熵控制方法,GEPO在多项基准测试中均取得一致提升。
基于梯度外推的策略优化
本文介绍了基于梯度外推的策略优化(GXPO),这是一种仅使用三次反向传播即可在大型语言模型(LLM)的强化学习训练中近似多步前瞻的方法。它在保持固定活跃阶段成本的同时,在数学基准测试上展示了优于标准 GRPO 的推理性能。