在模型改变主意之处分叉:树结构强化学习中的信念偏移分支

arXiv cs.AI 论文

摘要

本文提出了一种用于树结构强化学习的信念偏移分支方法,以增强步骤级信用分配,并在数学和编程基准测试中展示了性能提升。

arXiv:2609.11061v1 公告类型:新 摘要:树结构展开为无评论者的强化学习提供可验证奖励(RLVR)的步骤级信用:在中间点处分叉链路,通过兄弟节点结果差异估计步骤价值。每次分叉都会增加采样成本,因此在实际预算中,通常每条链路只允许少数分叉。在结果已基本确定的位置分叉,产生的兄弟节点大多一致,几乎没有提供信用信号;因此,对于给定的树大小,分叉的位置很大程度上决定了步骤级RL能获得多少收益。大多数现有主流方法根据结构放置分叉,例如固定长度、中点和分隔符,或基于下一个词元的熵。我们将分叉放置形式化为定位链路价值曲线的\emph{枢轴},即预期结果转折之处。我们提出\emph{信念偏移分支}:在候选边界处读取模型的答案信念,并在连续信念差异最大的步骤之前分叉。三种实例化方法,均不需要步骤级监督,覆盖不同访问层级:黑盒探针、logit透镜深度分析,以及学习到的激活方向,后者离线拟合,因此仅用于RL训练前的验证。该信号仅用于\emph{放置}分叉,探针在展开引擎内运行时,在数学任务上约占步骤计算的$1\%$,在编程任务上低于$5\%$。在该验证中,与蒙特卡洛价值曲线相比,信念偏移信号在八个模型$\times$基准测试面板中均排名第一,领先于熵、结构和LLM裁判基线。在跨三个模型家族和两个领域的RL中,信念偏移分叉在所有数学聚合指标上领先,在OLMo-3-7B上聚合提升$+2.6$,在AIME 2026上提升$+2.9$,超过最强基线,并在所有OLMo编程列上大获全胜,在LiveCodeBench-medium上提升$+6.5$。
查看原文
查看缓存全文

缓存时间: 2026/09/12 08:22

# 模型改变主意之处的分支:用于树结构强化学习的信念转移分支
来源:https://arxiv.org/html/2609.11061
Yu LiAffiliation:Salesforce AI ResearchPrafulla Kumar ChoubeyAffiliation:Salesforce AI ResearchJiaxin ZhangAffiliation:Salesforce AI ResearchBecky Xiangyu PengAffiliation:Salesforce AI ResearchQinyuan YeAffiliation:Salesforce AI ResearchKartik NarayanAffiliation:Salesforce AI ResearchCaiwen DingAffiliation:University of MinnesotaSilvio SavareseAffiliation:Salesforce AI ResearchChien\-Sheng WuEmail:[\{bin\.lei,yu\.li,pchoubey,jiaxin\.zhang,becky\.peng\}@salesforce\.com\{qinyuan\.ye,kartik\.narayan,ssavarese,wu\.jason\}@salesforce\.com \{lei00126,dingc\}@umn\.edu](mailto:)Affiliation:Salesforce AI Research
###### 摘要
树结构展开为无评论者、具有可验证奖励的强化学习提供了步级信用分配:在中间点分叉一条链,兄弟节点的结果差异可以估计步值。每次分叉都会增加采样成本,因此在实际预算下通常只允许每条链进行少数几次分叉。如果在一个结果已大致确定的位置进行分叉,产生的兄弟节点大多会达成一致,几乎不提供任何信用信号;因此,对于给定的树大小,分叉放置的位置在很大程度上决定了步级强化学习能获得多少收益。大多数现有主流方法通过结构来放置分叉,例如固定长度、中点、分隔符,或基于下一个词元的熵。我们将分叉放置形式化为定位链的*价值曲线*的*枢轴点*,即预期结果发生转变的地方。我们提出*信念转移分支*:在候选边界处读取模型的答案信念,并在连续信念分歧最大的步骤之前进行分叉。我们通过三个不需要步级监督的实例化方法来实现,它们涵盖了不同的访问级别:黑盒探测、对数透镜深度剖面图,以及离线拟合的学习激活方向(因此仅在强化学习训练前的验证中使用)。该信号仅用于*定位*分叉点,探测在数学任务上大约消耗1%的步级计算量,在代码任务上低于5%(当它在展开引擎内部运行时)。在该验证中,与蒙特卡洛价值曲线相比,信念转移信号在每个模型×基准测试面板中排名第一,领先于熵、结构化和LLM判断基线。在跨三个模型家族和两个领域的强化学习中,信念转移分叉在所有数学任务汇总指标上均领先;在OLMo\-3\-7B上,比最强基线高出+2.6个汇总指标点和+2.9个AIME 2026分数;并在所有OLMo代码列上全面领先,在LiveCodeBench\-medium上高出+6.5分。

## 1 引言
图 1:OLMo\-3\.1\-32B\-Think在AIME 2025上的一个推理链;128个换行符边界,每个选择器有十个分叉点;x轴:链位置(比例)。\*上图\*:真实值V∗(每个边界16次蒙特卡洛补全);红色虚线:八个\|ΔV∗\|\≥0\.25的价值枢轴点;阴影区域:已确定区域(V∗\equiv1);星号:分叉位置。十个分叉捕获的翻转质量,∑\{forks\}\|ΔV∗\|:探测\-JS为1\.56,而熵为0\.44,后者在已确定区域使用了六个分叉。完整案例:附录F (https://arxiv.org/html/2609.11061#A6)。
具有可验证奖励的强化学习通过为每个采样解决方案分配一个标量奖励来训练推理模型\[11 (https://arxiv.org/html/2609.11061#bib.bib9),33 (https://arxiv.org/html/2609.11061#bib.bib8)\]。组相对方法将该标量复制到每个词元上,导致两端信用分配错误:一个幸运地得到正确解决方案的有缺陷步骤会被完全强化,而一个所有展开都失败的提示会产生零梯度\[40 (https://arxiv.org/html/2609.11061#bib.bib10),36 (https://arxiv.org/html/2609.11061#bib.bib6)\]。树结构展开无需评论者即可修复此问题:在中间位置分叉轨迹,兄弟节点续写的经验证的结果差异就是分叉步骤优势的反事实估计\[14 (https://arxiv.org/html/2609.11061#bib.bib12),39 (https://arxiv.org/html/2609.11061#bib.bib40),20 (https://arxiv.org/html/2609.11061#bib.bib17)\]。问题是成本:每次分叉都会增加展开词元,因此在实际预算下通常只允许每条链进行少数几次分叉。这些稀缺的分叉应该放在哪里?
在无评论者的树强化学习中,这是一个开放的设计选择:树已经将兄弟节点结果转化为步级信用,因此剩下的就是决定兄弟节点应该重新展开哪个步骤。当前的选择器在做这个决定时,没有问这个步骤*决定*了什么:TreePO和TreeRPO在固定的词元网格上分叉\[20 (https://arxiv.org/html/2609.11061#bib.bib17),39 (https://arxiv.org/html/2609.11061#bib.bib40)\],早期的步级方法在分隔符处切割\[21 (https://arxiv.org/html/2609.11061#bib.bib3)\],TreeRL和FR3E在下一个词元不确定性峰值处分叉,ARPO在工具调用后熵上升处分叉\[14 (https://arxiv.org/html/2609.11061#bib.bib12),43 (https://arxiv.org/html/2609.11061#bib.bib18),6 (https://arxiv.org/html/2609.11061#bib.bib35)\]。不确定性是自然的候选指标,但它跟踪的是*措辞*的自由度而非*结果*的自由度:熵会因可互换的同义改写而虚高\[17 (https://arxiv.org/html/2609.11061#bib.bib37)\],并且对于任何自信书写的步骤(无论对错),它读数都接近零,而答案探测则会在步骤改变模型自身答案时发生变化。与此一致的是,TreeRL基于惊讶度的分叉(其“熵”)在其自身的采样消融实验中,比*随机*分叉的通过率高2\.1分,而TreePO静态概率引导的分支分配不如均匀分配。
我们提出信念转移分支:沿着链条追踪模型对最终答案的信念,并在连续候选边界之间信念转移最大的地方进行分叉。我们用三种跨越访问级别的读取来实例化它——从仅输出采样到内部激活——都不需要步级监督。
PROBE\-JS是一种黑盒读取,类似于突击测验:在每个边界处,它用一个约10词元的探测(“那么你的最终答案是什么?”)打断模型,引出答案分布,并通过相邻分布之间的Jensen\-Shannon散度对边界进行评分,因此急剧的跳跃标志着枢轴点或错误;它只需要采样访问,代价是每个边界多一次短生成。
LENS\-SHIFT是一种白盒读取——更像是X光而非测验——它问同样的问题但不让模型开口:给定最终答案,对数透镜读取每个层已经对答案承诺的强度,在每个边界处生成一个深度剖面图,该剖面图在边界之间的大幅变化标志着信念转移,无需额外生成。
信念转移向量(BSV)是一个预先校准的雷达:通过对比高置信度下的激活与怀疑下的激活,它在RL之前离线拟合一个用于“置信度转移”的单一激活方向,因此对边界评分只需将其隐藏状态投影到这个轴上。由于BSV最直接地衡量信念转移,我们用它来测试:如果模型的真实信念转移可以被直接测量,它是否能更准确地跟踪真实的价值曲线。探测在数学任务上大约消耗训练步的1%,在代码任务上低于5%(当由展开引擎服务时(第3\.6节 (https://arxiv.org/html/2609.11061#S3.SS6)),并且该信号仅用于*定位*分叉点。信用分配仍来自经验证的兄弟节点结果,因此一个未校准的信念只会浪费一次分叉,但不会破坏训练。
图1 (https://arxiv.org/html/2609.11061#S1.F1)在一条真实链上对比了Probe\-JS与熵,该链针对蒙特卡洛真实价值曲线:给定十个分叉点,探测的分叉点捕获了熵的3\.6倍的价值移动量(∑\|ΔV∗\|:1\.56 vs\. 0\.44),而熵在V∗\equiv1的已确定区域浪费了六个分叉点。
*在*强化学习*之前*,我们根据蒙特卡洛价值曲线对选择器进行评分:信念转移信号在每个模型×基准测试面板中排名第一,领先于熵、结构化和LLM判断基线,并且可以零样本迁移到域外基准测试(第4节 (https://arxiv.org/html/2609.11061#S4))。
*在*强化学习*期间*,四个仅在分叉标准上不同的实验臂,在匹配的预算下跨越三个模型家族和两个领域:一个信念转移臂在所有数学任务汇总指标上领先(在OLMo\-3\-7B AIME 2026上比最强基线高+2\.9),并在所有OLMo代码列上全面领先(第6节 (https://arxiv.org/html/2609.11061#S6))。消融实验覆盖了树预算(M,k)、策略更新器、探测读取长度L,以及Lens\-Shift读出,均在OLMo\-3\-7B数学任务上进行,还包括Qwen3\-4B与Qwen3\-8B的模型规模对比(第7节 (https://arxiv.org/html/2609.11061#S7))。

## 2 背景与相关工作
#### 轨迹级RLVR及其盲点。
组相对RLVR\[33 (https://arxiv.org/html/2609.11061#bib.bib8),40 (https://arxiv.org/html/2609.11061#bib.bib10)\]给响应的每个词元分配相同的优势A^i∝Ri−R̄。这导致两个病理现象:最终答案奖励会留下更多推理有缺陷的正确解决方案\[36 (https://arxiv.org/html/2609.11061#bib.bib6)\],而全平局提示会产生零梯度\[40 (https://arxiv.org/html/2609.11061#bib.bib10)\]。过程监督在推理环境中改进了仅结果训练\[37 (https://arxiv.org/html/2609.11061#bib.bib4),41 (https://arxiv.org/html/2609.11061#bib.bib7),32 (https://arxiv.org/html/2609.11061#bib.bib38)\],过程优势验证器可带来高达6倍的RL样本效率提升\[32 (https://arxiv.org/html/2609.11061#bib.bib38)\]。
#### 三种展开结构,同源输入。
在没有任何学习到的价值估计器(无论是显式评论者还是从结果训练的对数比中恢复的隐式估计器\[41 (https://arxiv.org/html/2609.11061#bib.bib7),5 (https://arxiv.org/html/2609.11061#bib.bib42)\])的情况下,步值必须来自额外采样:(a) 从步前缀进行的蒙特卡洛补全\[16 (https://arxiv.org/html/2609.11061#bib.bib13),37 (https://arxiv.org/html/2609.11061#bib.bib4),12 (https://arxiv.org/html/2609.11061#bib.bib39)\];(b) MCTS风格的树,在实践中用于离线或结合学习到的价值模型标记过程监督\[10 (https://arxiv.org/html/2609.11061#bib.bib31),42 (https://arxiv.org/html/2609.11061#bib.bib14),25 (https://arxiv.org/html/2609.11061#bib.bib5),4 (https://arxiv.org/html/2609.11061#bib.bib15),8 (https://arxiv.org/html/2609.11061#bib.bib16)\];(c) 在策略分支树,其节点统计直接产生RL优势,无需任何价值模型\[14 (https://arxiv.org/html/2609.11061#bib.bib12),39 (https://arxiv.org/html/2609.11061#bib.bib40),20 (https://arxiv.org/html/2609.11061#bib.bib17),6 (https://arxiv.org/html/2609.11061#bib.bib35)\],即我们所处的场景。所有三种结构消耗相同的输入:链条可以被切割的边界,而在实际预算下每条链只能负担少数几个这样的边界。
表 1:现有分叉点选择器。很少有在分叉时读取结果的:网格和分隔符遵循表面结构,惊讶度和熵跟踪措辞自由度,而语言模型判断器读取正确性但需要对每个步骤进行一次外部生成调用。
#### 现有分叉选择器大多是对结果不敏感的代理。
令V∗(t)=Pr\[correct∣x,y≤t\];在t时刻的兄弟比较估计了V∗的局部变化,因此理想的选择器应针对V∗(不可观测的)枢轴点。实践用从未读取结果的代理来近似它们(表1 (https://arxiv.org/html/2609.11061#S2.T1))。
*分隔符*:PRM800K微调生成器以发出换行符步骤\[21 (https://arxiv.org/html/2609.11061#bib.bib3)\],而表面词元通常不会标记真正的决策点\[23 (https://arxiv.org/html/2609.11061#bib.bib41)\]。
*固定长度网格*\[20 (https://arxiv.org/html/2609.11061#bib.bib17),39 (https://arxiv.org/html/2609.11061#bib.bib40)\]在表达式中途分叉;TreePO静态概率引导的分支分配在其固定段上不如均匀分配(他们的§4\.4)。
*下一个词元不确定性*(TreeRL的采样词元惊讶度,FR3E的熵,ARPO的工具调用后熵\[14 (https://arxiv.org/html/2609.11061#bib.bib12),43 (https://arxiv.org/html/2609.11061#bib.bib18),6 (https://arxiv.org/html/2609.11061#bib.bib35)\])衡量的是措辞而非结果(第1节 (https://arxiv.org/html/2609.11061#S1)),并且在TreeRL自身的采融实验中,在相同树配置下比*随机*分叉的通过率高2\.1分,同时生成的词元约少8%。SPO\[12 (https://arxiv.org/html/2609.11061#bib.bib39)\]已经将蒙特卡洛切割点移出固定网格,将其放置在低概率词元上,前提是只有在值可能改变的地方边界才值得采样;我们认同这个前提,但其读取的是采样词元的概率,而我们读取的是模型对答案的信念。
*语言模型判断器*是离线且昂贵的\[19 (https://arxiv.org/html/2609.11061#bib.bib34)\],而学习到的奖励在RL期间可能被利用\[11 (https://arxiv.org/html/2609.11061#bib.bib9)\];*代理回合*\[44 (https://arxiv.org/html/2609.11061#bib.bib32),30 (https://arxiv.org/html/2609.11061#bib.bib33)\]如果在T个回合上穷尽分支则需要K^T次展开。

## 3 信念转移分支
#### 模板。
分叉点选择器是定义在候选边界上的评分规则:给定一个链条y及其候选边界池B(y)(第3\.1节 (https://arxiv.org/html/2609.11061#S3.SS1)),它为每个边界t∈B(y)分配一个分数s\_t,并在得分最高的边界t̂=argmax\_t s\_t处分叉。我们的选择器都采用一种形式:在每个边界处读取模型当前的*答案信念*,并根据该信念在相邻边界之间移动的程度对边界之间的片段进行评分,s\_{t⁻}=D(b\_{t⁻},b\_t),其中t⁻是B(y)中紧邻t之前的边界,D是特定实例化的信念变化度量(一种散度或剖面图变化范数;第3\.4节 (https://arxiv.org/html/2609.11061#S3.SS4)的学到读取方式是将单个边界状态h\_t投影到拟合好的信念转移方向上)。注意*分叉在之前*的归属:信念变化是由片段(t⁻, t]引起的,因此分数归属到t⁻,兄弟节点重新展开的正是这个移动信念的步骤。
三个实例化仅在b\_t的读取方式上有所不同:Probe\-JS需要采样访问,Lens\-Shift读取隐藏状态,而BSV将读取操作摊销到一个离线拟合的方向上,这将其限制在RL训练前的验证中——用于测试如果模型的真实信念转移可以被直接测量,它是否能更准确地跟踪真实的价值曲线(第3\.4节 (https://arxiv.org/html/2609.11061#S3.SS4))。

### 3\.1 候选步边界
词元中途的分叉会产生仅因琐碎词汇原因不同的兄弟节点,因此候选边界被限制在*步边界*:在所选分隔符(这里是换行符\n)之后的位置,这是我们在测试的两个任务(数学和代码)中自然的步骤分隔符。每条链最多对C=16个均匀分布的候选边界进行评分;如果一条链的跨度内没有边界,则在该跨度的中点切割,以便它仍然可以分叉。只有一条完全无法分叉的链(在上次切割后少于两个词元,或没有剩余响应预算用于续写)才会被替换为一条新的根链(第3\.5节 (https://arxiv.org/html/2609.11061#S3.SS5)),因此每个臂总是生成其完整的树。
图 2:三种信念读取方式:Probe\-JS比较连续引发的答案分布(JS);Lens\-Shift采用……

相似文章

过程奖励引导的树状展开实现高效多轮强化学习

arXiv cs.CL

提出PaTR,一个过程奖励引导的自适应树状展开框架,用于LLM智能体的多轮强化学习。它选择性地从有希望的中间状态进行分支,并剪枝死胡同路径,在相同训练预算下,在SWE-Bench上最高提升+5.0,在FrozenLake上提升+9.3。

Contrastive Branch Policy Optimization

arXiv cs.LG

CBPO引入了一种对比分支策略优化方法,用于具有可验证奖励的强化学习中的细粒度信用分配,提升了语言模型在多个基准测试中集成工具的推理任务的性能。