FlowBalance:基于验证器的自我改进,源自在策略推理经验
摘要
FlowBalance是一种基于验证器的自我改进方法,通过校准在策略推理经验来增强AI模型在数学推理任务中的性能和稳定性。
arXiv:2609.03241v1 Announce Type: new
摘要:推理模型可以从其自身的在策略经验中改进,但这个内部循环是脆弱的:终端验证器提供可靠但稀疏的监督,而密集的同模型指导可能强化虚假自信或使学习过度集中于狭窄的解决方案模式。我们引入FlowBalance,一种基于验证器的自我改进方法,学习完整响应的归一化分布。对于每个在策略轨迹,同一策略的冻结训练时视图使用特权上下文生成令牌级别的对数概率增益,这些增益被聚合成轨迹级别的自我指导分数。FlowBalance使用验证器派生的组优势来校准这个分数:在正优势轨迹上保留指导,在负优势轨迹上反转指导,并在滚动组未提供结果偏好时禁用指导。由此产生的能量指数级地重新加权参考策略,而轮廓化的轨迹平衡通过每个滚动组一个对数配分估计来拟合归一化目标。这通过轨迹平衡实现了结果校准的自我指导,无需单独的令牌级别模仿损失。我们的分析确立了组内对比保留、最小变化反向KL表征、验证器对目标奖励的单调控制,以及针对被拒绝响应上假阳性自我指导的精确校正。在数学推理任务上,FlowBalance在Qwen3-4B和Qwen3-8B上相比FlowRL提高了平均性能,同时改善了训练速度和稳定性,避免了直接OPSD的响应长度崩溃,并在受控的AIME24诊断中展示了更高的正确策略多样性。
查看缓存全文
缓存时间: 2026/09/04 06:23
# FlowBalance:基于验证器的自我改进与策略内推理经验
来源:https://arxiv.org/html/2609.03241
Kishan Panaganti\*†\\daggerHaitao MiLeowei Liang隶属关系:隶属关系:\[2026年9月3日]
###### 摘要
推理模型可以从其自身的策略内经验中改进,但这个内部循环很脆弱:终端验证器提供可靠但稀疏的监督,而密集的同模型指导可能强化错误信心或使学习过度集中于狭窄的解决方案模式。我们引入FlowBalance,这是一种基于验证器的自我改进方法,它学习完整响应的归一化分布。对于每个策略内轨迹,同一策略的冻结训练时视图利用特权上下文生成逐token对数概率增益,这些增益被聚合成轨迹级自我指导分数。FlowBalance使用验证器衍生的组优势校准此分数:在正优势轨迹上保留指导,在负优势轨迹上反转指导,并在展开组不提供结果偏好时禁用指导。所得能量指数级地重新加权参考策略,并且通过拟合轨迹平衡,每个展开组使用一个对数配分估计来拟合归一化目标。这实现了*基于轨迹平衡的校准结果自我指导*,而无需单独的逐token模仿损失。我们的分析建立了组内对比保留、最小变化反向KL表征、目标奖励的单调验证器控制,以及对拒绝响应上假阳性自我指导的精确校正。在数学推理中,FlowBalance在Qwen3\-4B和Qwen3\-8B上的平均性能均优于FlowRL,同时还提高了训练速度和稳定性,避免了直接OPSD的响应长度崩溃,并在受控的AIME24诊断中表现出更高的正确策略多样性。
## 1引言
后训练的一个核心承诺是推理模型可以从其自身的经验中改进:采样多个解决方案,评估哪些有效,并更新策略,使得下一轮的经验更好。我们从这个操作意义上使用*自我改进*——在训练时反馈下,从模型自身的策略内轨迹重复进行策略改进——而非声称这是一个完全自主或闭环的系统。对于长视野推理,这个内部循环必须学习不止是更高的平均奖励。它必须将概率向正确的推理移动,保留有用的替代策略,并避免反复强化一个局部偏好的轨迹[[Guan等人, 2026 (https://arxiv.org/html/2609.03241#bib.bib35),Kujawa等人, 2025 (https://arxiv.org/html/2609.03241#bib.bib36),Ren和Sutherland, 2025 (https://arxiv.org/html/2609.03241#bib.bib37)]\]。两种失败模式使这个循环变得脆弱。首先,带可验证奖励的强化学习提供了可靠的结果基础,但仅通过稀疏的终端反馈\[Shao等人, 2024 (https://arxiv.org/html/2609.03241#bib.bib13),Yu等人, 2025c (https://arxiv.org/html/2609.03241#bib.bib12)\]。一个响应可能包含数百或数千个token,而验证器只提供一个最终奖励;基于组的目标改善了跨响应的比较,但仍然将响应级信号附加到每个决策上。分布方法(如FlowRL)改善了如何将这种终端证据转化为完整响应上的概率\[Zhu等人, 2025 (https://arxiv.org/html/2609.03241#bib.bib11)\],但仅基于结果的能量无法利用采样推理路径上的细粒度证据。其次,模型可以使用更知情的训练时视图重新评估其自身的采样轨迹。当前策略的冻结副本可以根据参考解决方案或任务反馈条件化,并为每个采样的token评分\[Zhao等人, 2026a (https://arxiv.org/html/2609.03241#bib.bib1),Hübotter等人, 2026 (https://arxiv.org/html/2609.03241#bib.bib2)\]。这种同模型、特权事后信号是密集且低成本的:它既不需要更大的外部模型,也不需要额外的生成响应。然而,密集的自我指导并非自动可信。因为评分视图观察到了推理时不可用的信息,它可能偏好一个看似合理但最终被拒绝的轨迹,缩短推理,抑制不确定性驱动的探索,或使更新集中在狭窄的局部模式周围\[Kim等人, 2026b (https://arxiv.org/html/2609.03241#bib.bib4),Zhu等人, 2026 (https://arxiv.org/html/2609.03241#bib.bib6)\]。盲目跟随这种信心会产生*自我确认*:模型自身的错误偏好成为下一次更新的监督。因此,我们提出一个分布式的自我改进问题:
> *给定策略内推理经验、稀疏的已验证结果以及密集但不完美的自我指导,下一个策略应学习何种归一化响应分布?*
我们引入FlowBalance,一种基于验证器的自我改进算子,它通过*基于轨迹平衡的校准结果自我指导*来回答这个问题。当前策略生成一个展开组。验证器提供停止的组相对优势。同一策略的冻结特权事后视图随后使用仅训练上下文为已采样的token评分。FlowBalance将这些分数聚合成轨迹级指导增益,使用验证器确定其方向,并通过拟合轨迹平衡拟合所得的参考支持的吉布斯目标。策略仅通过此完整响应分布匹配目标进行优化;没有单独的逐token模仿损失。
请参见标题图1:FlowBalance作为基于验证器的自我改进循环。当前策略生成策略内推理经验(1);验证器提供稀疏但可靠的结果反馈(2);同一策略的冻结特权事后视图为采样token提供密集自我指导(3);符号门控将该指导基于已验证结果(4);拟合轨迹平衡将所得归一化响应分布内在化(5)。刷新冻结快照会重复此内部循环。
对于提示x,令G=\(y\(1\),...,y\(N\)\)\\mathcal\{G\}\=\(y^\{\(1\)\},\\ldots,y^\{\(N\)\}\)为策略内展开组,令Ai=AG\(y\(i\)\)A\_\{i\}\=A\_\{\\mathcal\{G\}\}\(y^\{\(i\)\}\)为其停止的组相对验证器优势。特权事后评分视图πH\\pi\_\{\mathrm\{H\}\}以仅训练上下文cc为条件,并生成相对于参考策略的裁剪逐token对数概率增益。它们的轨迹平均值是自我指导增益GH\(y\(i\)∣x,c\)G\_\{\mathrm\{H\}\}\(y^\{\(i\)\}\\mid x,c\)。FlowBalance定义:
EFlowBalance,G\(y\(i\)∣x,c\)=ηAAi+βGGH\(y\(i\)∣x,c\)sgn\(Ai\).
E\_\{\mathrm\{FlowBalance\},\mathcal\{G\}\}\(y^\{\(i\)\}\\mid x,c\)=\\eta\_\{A\}A\_\{i\}\+\\beta\_\{G\}G\_\{\mathrm\{H\}\}\(y^\{\(i\)\}\\mid x,c\)\\operatorname\{sgn\}\(A\_\{i\}\). (1)
验证器项锚定了改进的方向。当Ai\>0A\_\{i\}\>0时,正的自我指导可以强化已验证的响应;当Ai<0A\_\{i\}<0时,相同的正指导被反转,而不是允许其自我确认失败;当Ai=0A\_\{i\}=0时,密集分支被禁用。因此,指导细化了验证器的方向,而不是覆盖它。以已实现的组为条件,FlowBalance定义参考支持的目标:
pFlowBalance,G⋆\(y∣x,c\)∝πref\(y∣x\)exp(EFlowBalance,G\(y∣x,c\)τ),
p^\{\star\}\_\{\mathrm\{FlowBalance\},\mathcal\{G\}\}\(y\\mid x,c\)\\propto\\pi\_\{\mathrm\{ref\}\}\(y\\mid x\)\\exp\\\!\\left\(\\frac\{E\_\{\mathrm\{FlowBalance\},\mathcal\{G\}\}\(y\\mid x,c\)\}\{\\tau\\}\\right\), (2)
并通过拟合轨迹平衡残差ΔTB\(y,x,c,G\)=τlogZFlowBalance,G\(x,c\)+τlogπθ\(y∣x\)πref\(y∣x\)−EFlowBalance,G\(y∣x,c\)来拟合它。
\\Delta\_\{\\mathrm\{TB\}\}\(y;x,c,\\mathcal\{G\}\)=\\tau\\log Z\_\{\\mathrm\{FlowBalance\},\\mathcal\{G\}\}\(x,c\)\+\\tau\\log\\frac\{\\pi\_\{\\theta\}\(y\\mid x\)\}\{\\pi\_\{\\mathrm\{ref\}\}\(y\\mid x\)\}\-E\_\{\\mathrm\{FlowBalance\},\\mathcal\{G\}\}\(y\\mid x,c\). (3)
每个展开组拟合一个对数配分估计。参考策略控制支持和漂移,验证器决定结果方向,特权事后视图提供密集的轨迹内证据,轨迹平衡将它们的组合能量转换为完整响应上的归一化分布。这种构建也可以被视为*分布式内部循环更新*:任务源提供提示,当前策略提供经验,FlowBalance将\{\(yi,Ri,GH,i\)\}i=1N\\\{\(y\_\{i\},R\_\{i\},G\_\{\mathrm\{H\},i\}\)\\\}\_\{i=1\}^\{N\}映射到目标分布,策略拟合产生下一个策略。我们的实验有意固定任务分布,将此经验到策略的更新与外层循环的任务生成或课程演进隔离开来。后者是补充性的,而非方法所假设的。我们的分析直接研究诱导的目标。我们表明,拟合配分保留了所有组内概率对比;将FlowBalance表征为在其实现的组合能量水平下相对于参考的唯一最小反向KL位移;建立了目标奖励统计量的单调验证器控制;并精确量化了结果校准如何将拒绝响应上的假阳性自我指导转换为有利于已验证响应的概率比率校正。这些是目标及其局部拟合目标的特性,而不是针对任意神经优化器的全局收敛性的主张。
在数学推理方面,FlowBalance在GRPO、OPSD、RLSD、FlowRL和FlowBalance中,在Qwen3\-4B和Qwen3\-8B上均获得了最强的总体平均性能。相对于FlowRL,它在Qwen3\-4B上将核心四个基准(AIME24、HMMT25、MATH500和OlympiadBench)的平均性能提高了1\.671\.67点,在Qwen3\-8B上提高了1\.981\.98点,同时还提高了完整聚合平均。在Qwen3\-8B上,FlowBalance在大约100100步内达到0\.50\.5的AIME24验证准确率,而GRPO大约需要143143步,超过400400步后保持稳定,并避免了在直接OPSD下观察到的响应长度崩溃。受控的AIME24诊断进一步发现,与GRPO和RLSD相比,其具有更高的仅正确语义策略多样性。我们的贡献包括:
- •一个分布式自我改进目标,优于仅验证器RL和RL–自我指导混合体。GRPO通过稀疏的验证器结果改进推理,而RLSD通过密集的同模型指导增强基于验证器的策略优化。FlowBalance解决了一个不同的问题:*下一个策略应从这些信号中学习何种归一化的完整响应分布?*它将验证器优势和特权事后指导结合到一个参考支持的轨迹能量中,然后通过拟合轨迹平衡拟合诱导的分布。这使得与GRPO和RLSD的比较尤其具有启发性:FlowBalance不仅仅是向GRPO添加更多监督,或向RL目标插入另一个指导项;它将策略更新对象从局部优化信号更改为模型自身推理轨迹上明确归一化的分布。
*具体证据。*在核心四个基准(AIME24、HMMT25、MATH500和OlympiadBench)的平均性能上,FlowBalance在Qwen3\-4B上比GRPO提高了2\.602\.60点(67\.6967\.69 vs 65\.1065\.10),在Qwen3\-8B上提高了2\.442\.44点(71\.0971\.09 vs 68\.6568\.65)。相对于RLSD,在Qwen3\-4B上相应增益为5\.835\.83点(67\.6967\.69 vs 61\.8761\.87),在Qwen3\-8B上为4\.184\.18点(71\.0971\.09 vs 66\.9266\.92)。在完整的五个基准聚合上,相同的排序成立:FlowBalance在4B和8B骨干上分别超过GRPO 1\.951\.95和2\.122\.12点,超过RLSD 4\.714\.71和3\.493\.49点。在Qwen3\-8B上,它还在大约100100步内达到0\.50\.5的AIME24验证准确率,而不是GRPO的大约143143步,并且在400400步内保持接近其峰值,而GRPO在大约第180180步后性能下降。这些结果孤立了实际贡献:学习基于验证器的轨迹分布优于仅基于结果的RL和直接RL–密集指导组合在两个模型规模上的表现。
- •结果校准的自我指导,将错误信心转换为基于验证器的校正。特权事后视图被特意视为*有用但不完美*:它可以识别有前景的推理结构,但它也可能为一个未能通过验证器的轨迹分配积极的置信度。因此,FlowBalance在组相对优势为正时使用\+GH\+G\_\{\mathrm\{H\}\},为负时使用−GH\-G\_\{\mathrm\{H\}\},当组未提供结果偏好时则不使用指导。这不仅仅是一个启发式过滤器。命题4 (https://arxiv.org/html/2609.03241#Thmproposition4)表明,对于一个已验证的成功和一个被拒绝的响应,符号门控将它们的目标概率比乘以一个精确因子exp(2βGGH\(y−\)/τ)\\exp\(2\\beta\_\{G\}G\_\{\mathrm\{H\}\}\(y\_\{\-\}\)/\\tau),相对于未门控的指导。因此,密集的同模型证据可以细化已验证的成功,而不会让一个高置信度评分的失败成为自我强化的监督。
*具体证据。*在精确的四模式诊断中,仅奖励塑形达到成功质量0\.8180\.818,未门控的自我指导达到0\.8320\.832,而FlowBalance达到0\.9000\.900,同时将稳健成功模式从仅奖励塑形下的0\.3270\.327增加到0\.4400\.440。在G−=0\.5G\_\{\-\}=0\.5的二元错误置信度扫描中,FlowBalance达到目标成功概率0\.8940\.894,而仅奖励塑形为0\.8170\.817,未门控塑形为0\.8070\.807。语言模型结果显示出相同的定性区别:直接OPSD迅速崩溃为短响应,而FlowBalance保持长推理痕迹;此外,将指导系数从βG=1\\beta\_\{G\}=1增加到33使AIME24从89\.3389\.33降低到86\.0086\.00,HMMT25从34\.6734\.67降低到30\.0030\.00。因此,益处来自*校准的*自我指导,而不仅仅是让密集信号更强。
- •一种保守且信息高效的轨迹平衡更新,具有精确的目标级保证。FlowBalance为每个展开组拟合一个标量对数配分区间值,但这个多余参数仅移除公共偏移:所有N−1N\-1独立的组内概率对比仍可用于训练策略。诱导的目标也是在达到其期望组合能量水平的组分布中,相对于参考的唯一最小反向KL位移,并且增加验证器系数在固定指导下单调增加目标期望的验证器奖励。总之,这些结果将更新确定为一个有原则的最小变化自我改进步骤,它使用展开组的完整相对结构,同时将已验证的奖励保持为显式控制变量。
*具体证据。*精确的合成诊断量化了这两种效果。一个匹配能量的完全支持替代方案需要反向KL 0\.9730\.973,而FlowBalance的指数倾斜仅需要0\.2730\.273;因此,该替代方案比参考方案远3\.6×3\.6\\times。在展开组大小N=32N=32时,拟合所有对比产生的本地高斯参数风险仅为每组一个对比估计器的2\.92%2\.92\%——大约是其风险的1/341/34。与此一致相似文章
平衡思考的高效推理
本文介绍了ReBalance,一种无需训练、即插即用的方法,能够动态平衡大型推理模型中的过度思考与思考不足,在多个基准测试中提升效率与准确性。
Flow Reasoning Models: 通过迭代自我精化扩展推理能力
Flow Reasoning Models (FRMs) 为离散流模型在结构化推理任务上引入了一个训练和测试时扩展框架。通过使用 self-verification 和 self-conditioning,FRMs 在 Sudoku 和 Zebra 谜题上达到了近乎100%的求解率,而所需的迭代次数远少于之前的基准模型。
FlowBender: 自校正条件流的反馈感知训练
FlowBender 是一个闭环框架,通过训练网络利用推理时反馈来纠正对齐误差,从而提升扩散模型和流模型中的约束满足能力,优于传统的监督方法和基于引导的方法。
FlowEdit:针对涉及冲突的不适定问题的LLM推理流的信息论控制
FlowEdit 是一个新颖的框架,利用信息论原理来调节LLMs的内部推理流,使其能够针对具有冲突条件的不适定问题在单次生成中输出多个替代回答。实验表明,与领先的专有模型相比,精确集合匹配准确率提升68%,回答信息量提升24%。
ReasoningFlow: 用于理解LLM推理轨迹的篇章结构
介绍 ReasoningFlow,一个将大语言模型推理轨迹的篇章结构捕获为有向无环图的框架,从而能够细粒度分析推理行为(如自我反思和回溯)。基于对数千条轨迹的手动和自动标注,揭示了模型之间的结构相似性,并且大多数错误步骤并不贡献于最终答案。