基于强化学习后训练的语言模型组合推理
摘要
本文提出一个依赖图框架以形式化语言模型中的组合推理,并评估强化学习后训练的影响,发现了一种不对称性:组合技能训练向分解任务的迁移比反向更为容易。
arXiv:2609.19465v1 公告类型:新
摘要:组合推理对于现实世界的问题解决至关重要:由于训练数据必然有限,模型必须通过以新方式组合学习到的技能来进行泛化。尽管后训练方法如强化学习(RL)已显著提升了语言模型(LM)的推理能力,但它们对组合推理的影响仍知之甚少。我们提出一个依赖图框架以形式化组合推理,产生三个复杂度递增的组合性层次。通过实证研究,我们使用数据结构任务实例化该框架,这些任务提供确定性奖励计算和清晰的组合结构。我们发现一种一致的分解到组合的不对称性:分解技能训练不能可靠地迁移到组合任务,而组合任务训练更容易迁回分解任务。我们提供这种不对称性的理论解释,并进一步评估在长度外推、结构分布偏移和向需要未见技能的任务迁移下的组合泛化。最后,我们展示了一项针对现实世界工具调用基准的初步研究,提供了分解到组合不对称性可扩展到实际环境的初步证据。
查看缓存全文
缓存时间: 2026/09/18 09:18
# 强化学习后训练中语言模型的组合推理
来源:https://arxiv.org/html/2609.19465
###### 摘要
组合推理对于解决现实世界问题至关重要:由于训练数据必然有限,模型必须通过以新方式组合已学技能来实现泛化。虽然强化学习等后训练方法已显著提升了语言模型的推理能力,但它们对组合推理的影响仍不甚明确。我们提出一个基于依赖图的框架来形式化组合推理,并推导出复杂度递增的三个组合层次。实证上,我们使用数据结构任务实例化了该框架,这些任务提供了确定性的奖励计算和清晰的组合结构。我们发现了一种稳定的分解到组合不对称性:分解技能训练不能可靠地迁移到组合任务,而组合任务训练则更容易迁移到分解任务。我们为这种不对称性提供了理论解释,并进一步评估了在长度外推、结构分布偏移以及向需要未见技能的任务迁移等条件下的组合泛化能力。最后,我们在现实世界的工具调用基准上进行了一项试点研究,初步证据表明分解到组合不对称性可能扩展到实际场景。
### 1 引言
组合推理是通用智能的前提。模型不能仅仅学习个别技能;它必须系统性地重用和组合这些技能,以解决未见过的、更复杂的问题。这是必要的,因为现实世界的推理是开放性的,而训练数据本质上是有限的。模型无法针对可能遇到的每一个数学问题、程序或工具使用轨迹进行训练;相反,它必须通过以新方式组合熟悉的技能来实现泛化。随着语言模型承担起日益复杂的推理任务,理解其组合推理能力变得至关重要。然而,现有的语言模型组合性研究主要集中在语言理解中的语义组合[26 (https://arxiv.org/html/2609.19465#bib.bib3), 29 (https://arxiv.org/html/2609.19465#bib.bib2)]或指令遵循[23 (https://arxiv.org/html/2609.19465#bib.bib8)]上。相比之下,推理任务中的组合性理解则较少。与语言组合不同(其中原语可以清晰地对应于词语、短语或指令),推理任务通常涉及潜在技能,其定义和交互难以形式化。这使得系统性评估模型能否组合推理技能变得困难。另一方面,强化学习后训练最近已成为提升语言模型推理能力的核心方法[4 (https://arxiv.org/html/2609.19465#bib.bib19), 19 (https://arxiv.org/html/2609.19465#bib.bib18), 13 (https://arxiv.org/html/2609.19465#bib.bib28), 28 (https://arxiv.org/html/2609.19465#bib.bib29)]。然而,大多数关于组合推理的研究关注的是上下文学习[1 (https://arxiv.org/html/2609.19465#bib.bib9), 17 (https://arxiv.org/html/2609.19465#bib.bib10), 2 (https://arxiv.org/html/2609.19465#bib.bib7), 24 (https://arxiv.org/html/2609.19465#bib.bib6)]或监督微调[29 (https://arxiv.org/html/2609.19465#bib.bib2), 23 (https://arxiv.org/html/2609.19465#bib.bib8), 25 (https://arxiv.org/html/2609.19465#bib.bib27)]。关于强化学习对组合推理的影响,我们知道得还很少。例如,一种自然的方法是在单个技能上进行训练,较小的任务可能使设计强化学习奖励和验证器更容易。然而,目前尚不清楚语言模型在测试时能否组合这些学到的技能。为填补这一空白,我们使用依赖图框架来形式化组合推理。我们将技能定义为解决推理任务所需的可重用原语,并使用依赖图来建模它们之间的组合结构。该框架为系统性评估语言模型中的组合推理提供了形式基础。在实证评估方面,我们使用来自DSR-Bench[8 (https://arxiv.org/html/2609.19465#bib.bib14)]的数据结构任务实例化了该框架,这是一个评估语言模型结构推理能力的基准。数据结构非常适合这项研究,因为它们为强化学习奖励计算提供了确定性的、可验证的最终输出。此外,这些算法任务可以分解为清晰的技能,且这些技能组合的方式是明确且无歧义的。例如,在二叉搜索树构建中,插入是原语技能,而构建需要顺序应用此技能。这种受控环境使我们能够比较分解技能训练与组合任务训练,并分析强化学习后训练如何影响语言模型的组合推理能力。我们的贡献总结如下:
- • 我们的概念性贡献是一个框架,通过将任务表示为基于可重用原语技能的依赖图[图1 (https://arxiv.org/html/2609.19465#S1.F1)],形式化语言模型中的组合推理。该框架产生了三个难度递增的组合层次,各有不同的挑战:单技能链,隔离了跨度泛化挑战;多技能链,增加了技能切换挑战;以及分支-合并图,进一步增加了跨分支的非局部依赖(第3节 [https://arxiv.org/html/2609.19465#S3])。
- • 实证上,我们在三个组合层次上对分解技能训练与组合任务训练进行了受控的强化学习比较,并发现了一种一致的不对称性:分解技能训练向组合任务的迁移效果差,而组合任务训练向分解任务的迁移则相对容易。我们进一步评估了在三种迁移设置下的组合泛化能力:长度泛化、分布偏移和未见技能(第4节 [https://arxiv.org/html/2609.19465#S4])。
- • 我们通过误差累积和覆盖范围偏移,为分解到组合的不对称性提供了理论解释,表明组合推理需要在诱导状态分布上持续保持正确性,而分解监督可能无法覆盖这些分布(第5节 [https://arxiv.org/html/2609.19465#S5])。
- • 最后,我们在现实世界的工具调用基准上进行了一项试点研究,初步证据表明分解到组合的不对称性可以扩展到实际场景(第6节 [https://arxiv.org/html/2609.19465#S6])。
技能k1k2k3k4k5第一层次:单技能链(线性组合)k1k1k1k1结构:单一技能沿一条路径重复。第二层次:多技能链(线性组合)k1k2k1k2结构:不同技能沿一条路径混合。第三层次:分支-合并图(非线性组合)k3k1k2k2k4k5分支合并结构:多分支依赖图。复杂度递增挑战1:跨度泛化挑战2:技能切换挑战3:非局部依赖+ +分解到组合不对称性在分解技能上训练在组合任务上测试困难在组合任务上训练在分解技能上测试较容易
图1:复杂度递增的三个组合层次,以技能间的依赖结构表示。技能定义为解决推理任务所需的可重用原语。
### 2 相关工作
##### 组合泛化与技能组合。组合泛化在序列到序列学习中已被广泛研究,包括SCAN[12 (https://arxiv.org/html/2609.19465#bib.bib15)]、CFQ[9 (https://arxiv.org/html/2609.19465#bib.bib16)]和COGS[10 (https://arxiv.org/html/2609.19465#bib.bib17)],它们评估模型能否在新的语义结构中重组熟悉的原语。最近的工作将这一问题扩展到语言模型:SKILL-MIX[26 (https://arxiv.org/html/2609.19465#bib.bib3)]评估模型能否生成结合多种指定技能的文本;Zhao等[29 (https://arxiv.org/html/2609.19465#bib.bib2)]研究较小的模型能否从低阶示例中学习高阶技能组合;Yang等[23 (https://arxiv.org/html/2609.19465#bib.bib8)]研究指令遵循中的组合泛化;Yin等[25 (https://arxiv.org/html/2609.19465#bib.bib27)]研究可组合的思维链监督,用于从原子任务迁移到组合任务。这些工作研究了语言、指令或轨迹层面的重要组合形式。相比之下,我们关注推理任务,其中原语及其交互通常不如表层语言学那样明确。
##### 用于组合推理的强化学习后训练。使用可验证奖励的强化学习后训练最近已成为提升语言模型推理能力的核心方法[4 (https://arxiv.org/html/2609.19465#bib.bib19), 19 (https://arxiv.org/html/2609.19465#bib.bib18), 13 (https://arxiv.org/html/2609.19465#bib.bib28), 28 (https://arxiv.org/html/2609.19465#bib.bib29)],但其在组合迁移中的作用仍不甚了解。与我们工作最接近的是,Yuan等[27 (https://arxiv.org/html/2609.19465#bib.bib24)]表明强化学习可以教授字符串转换函数的嵌套组合,而Xu等[22 (https://arxiv.org/html/2609.19465#bib.bib25)]提出了Composition-RL,该方法通过组合现有提示来构建更难的可验证提示进行强化学习训练。Li等[14 (https://arxiv.org/html/2609.19465#bib.bib4)]研究了在监督微调和强化学习下视觉语言推理中的组合泛化。相比之下,我们关注基于文本的推理,并从算法推理的角度对组合结构进行受控研究。
##### 结构与算法推理。Dziri等[5 (https://arxiv.org/html/2609.19465#bib.bib26)]使用计算图分析固定的算法执行,并表明Transformer的性能可能随组合复杂度增加而下降。DSR-Bench[8 (https://arxiv.org/html/2609.19465#bib.bib14)]通过确定性的数据结构任务评估结构推理,最近的图推理工作使用强化学习来提升语言模型在图论任务上的表现[7 (https://arxiv.org/html/2609.19465#bib.bib21)]。我们在这一系列工作基础上,将数据结构作为强化学习后训练的受控环境,同时引入了一个依赖图框架来刻画可重用技能如何组合,并隔离了不同的瓶颈:跨度泛化、技能切换和非局部依赖。
### 3 组合性的依赖图框架
我们通过使用基于可重用技能的*依赖图*来形式化组合推理,展示我们的概念性贡献[图1 (https://arxiv.org/html/2609.19465#S1.F1)],以捕获推理任务中的组合结构。我们的框架产生了三个层次的组合性,分别隔离了不同的瓶颈:跨度泛化、技能切换和非局部依赖。该结构也使得我们能够分析分解技能训练与组合任务训练。更广泛地说,它为未来语言模型组合推理的实证和理论研究提供了形式基础。
##### 依赖图。对于任务实例τ∈T\tau\in\mathcal{T},令依赖图Gτ=(Vτ,Eτ)G_{\tau}=(V_{\tau},E_{\tau})是一个有限有向无环图(DAG),其中每个节点代表一次技能调用,每条边表示一个调用的输出是另一个调用所需的输入。直观上,GτG_{\tau}指定了*哪些*中间计算必须执行,*哪个*技能在每个步骤被调用,以及它们*如何*相互依赖;因此,它代表了任务内的组合结构。我们以输入{1,2,3}\{1,2,3\}的二叉搜索树构建任务作为贯穿全文的示例。
- • 技能。我们假设有一组可重用的技能原语K\mathcal{K}。每种技能类型k∈Kk\in\mathcal{K}都关联一个函数fk:Xk→Ykf_{k}:\mathcal{X}_{k}\rightarrow\mathcal{Y}_{k},其中Xk\mathcal{X}_{k}和Yk\mathcal{Y}_{k}分别表示该技能的输入和输出空间。例如,BST构建由一系列插入操作组成,其中插入充当可重用的技能原语。
- • 节点。一个节点v∈Vτv\in V_{\tau}被标记为技能类型κ(v)∈K\kappa(v)\in\mathcal{K},表示在该节点调用哪个技能。令zvz_{v}表示节点vv产生的中间输出。例如,向当前BST执行(插入,1)的具体操作是一次技能调用。
- • 边。一条边(u,v)∈Eτ(u,v)\in E_{\tau}表示依赖约束,即中间输出zuz_{u}是形成节点vv输入所必需的。令pred(v)={u∈Vτ:(u,v)∈Eτ}\mathrm{pred}(v)=\{u\in V_{\tau}:(u,v)\in E_{\tau}\}表示节点vv的前驱节点。节点vv的输入xvx_{v}和输出zvz_{v}通过以下方式计算:xv=ψv(lv,(zu)u∈pred(v))∈Xκ(v),zv=fκ(v)(xv).x_{v}=\psi_{v}\!\left(\ell_{v},\left(z_{u}\right)_{u\in\mathrm{pred}(v)}\right)\in\mathcal{X}_{\kappa(v)},\qquad z_{v}=f_{\kappa(v)}(x_{v}).这里,lv\ell_{v}表示由任务实例指定的局部信息(例如,要插入树中的值),ψv\psi_{v}是一个输入构建映射。例如,在(插入,1)之后,下一个操作(插入,2)以前一个操作产生的BST状态作为输入。
- • 输出。为简单起见,我们假设GτG_{\tau}有一个唯一的汇节点vsink∈Vτv_{\mathrm{sink}}\in V_{\tau}。任务的最终输出是该汇节点产生的中间输出zvsinkz_{v_{\mathrm{sink}}}。例如,BST构建的最终输出由技能调用(插入,3)的输出给出。
##### 三个组合层次。如图1所示[https://arxiv.org/html/2609.19465#S1.F1],我们在依赖图框架下形式化三个层次的组合性。
- • 第一层次:单技能链(线性组合)。单技能链是最简单的情况,相同的技能在一系列步骤中重复使用。形式上,GτG_{\tau}是一条路径,所有节点共享相同的技能类型,且|{κ(v):v∈Vτ}|=1|\{\kappa(v):v\in V_{\tau}\}|=1。此设置测试在较小实例上训练的模型能否外推到需要更多重复相同推理模式的更大实例。
- • 第二层次:多技能链(线性组合)。多技能链也具有路径结构的依赖图,但技能标签κ(v)κ(v)可能在节点间变化,且|{κ(v):v∈Vτ}|>1|\{\kappa(v):v\in V_{\tau}\}|>1。此设置测试模型能否在顺序组合异构技能时保持中间状态,包括处理技能切换和技能间的接口不匹配。
- • 第三层次:分支-合并图(非线性组合)。这里,GτG_{\tau}是一个一般的有向无环图,而非路径。*分支*发生在一个中间输出供多个下游节点使用时,而*合并*发生在一个节点依赖于多个上游输出时。
(a) 线性组合依赖顺序 = 执行顺序k1k2k4k5唯一有效的推理轨迹k1k2k4k5
(b) 非线性组合一条有效的推理轨迹对应任何拓扑排序。k3k1k2ak2bk4k5在k3之后,k1、k2a、k2b中的任何一个都可能是下一个。多个*序列化*的推理轨迹:k3k1k2ak2bk4k5✓\checkmarkk3k2ak1k2bk4k5✓\checkmarkk3k2bk2ak4k1k5✗非局部依赖:k4的执行需要相似文章
RL后训练构建组合推理策略
本文研究强化学习后训练是否能够将原始技能组合成更高层次的组合策略,使用一个完全可观测的重写语法环境。作者发现,RL通过分阶段的组合机制重新组织原始能力,而拒绝微调则因产生大量无效的捷径式重写而停滞不前。
揭示语言模型中的潜在推理策略
本文提出了一种方法,利用潜变量将语言模型的响应分布分解为结构化的、策略条件化的表示,并通过模型导向的重建目标来解决后验塌陷问题。
TimeThink:激发时间序列大型语言模型中的组合推理
TimeThink 引入了一个合成框架,通过带有可验证奖励的强化学习来增强时间序列大型语言模型中的组合推理,在合成和真实任务上显示出相对于基线的显著改进。
重新审视后训练中的完整推理轨迹
本文发现,在后训练期间,大型语言模型可以从截断的推理轨迹而非完整轨迹中获得推理改进,减少冗余的同时,有利于监督微调和强化学习等方法。
Looped语言模型改进组合工具调用
Looped语言模型通过利用循环计算来增强组合工具调用,在多步任务中提高准确性,同时自适应推理优化了性能和计算成本之间的平衡。研究表明,这些模型对于可靠的智能体系统很有前景。