VERPO:验证证据正则化策略优化
摘要
VERPO 引入了一个框架,用于在语言模型中进行验证证据正则化策略优化,通过将证据视为策略修正的提议,同时保持目标结果,以提高在科学推理和工具使用任务上的性能。
arXiv:2609.06100v1 公告类型:新
摘要:可验证的结果奖励指导语言模型的后期训练,但序列级优势无法识别哪些词级决策应保留或修正。证据条件教师通过重放采样轨迹并提供特权反馈来提供更密集的监督。然而,不加选择的模仿可能会转移不支持任务成功的格式或推理风格。我们引入了VERPO,一个验证证据正则化策略优化框架,它将证据视为策略修正的提议,同时保留结果目标。它将无证据的参考恢复与有符号的词级证据修正分离。Fisher证据对比减弱了沿着估计的证据存在方向的修正。一个停止的词级ZPD控制器根据局部奖励对齐和Fisher移动成本来缩放接受度,而参考通道保持独立于接受度。在五个科学推理和工具使用任务上,每个骨干上的最佳变体在平均分数上超过了最强的比较基线。平均分数在Qwen3-4B上从0.6826上升到0.6857,在Qwen3-8B上从0.6895上升到0.7058,在Llama-3.2-1B上从0.4751上升到0.5657。
查看缓存全文
缓存时间: 2026/09/10 08:32
# VERPO:基于验证证据的正则化策略优化 来源:https://arxiv.org/html/2609.06100 作者:Haijiang Li¹,Chengyu Lv²,Yi Zhang¹,Zhibing Zhang³,Rui Qian⁴,Yuchen Zhang⁵,Xiaofan Zhang⁶,Mingshan Wang⁶,Xiaofei Jing⁶,Yu Tong⁶,Cangqi Zhou⁵ ¹独立研究者 ²同济大学 ³南京大学 ⁴复旦大学 ⁵南京理工大学 ⁶小红书 邮箱:[[email protected]](mailto:[email protected]),[[email protected]](mailto:[email protected]),[[email protected]](mailto:[email protected]),[[email protected]](mailto:[email protected]),[[email protected]](mailto:[email protected]),[[email protected]](mailto:[email protected]),[[email protected]](mailto:[email protected]),[[email protected]](mailto:[email protected]),[[email protected]](mailto:[email protected]) ###### 摘要 可验证的结果奖励能够指导语言模型的后训练,但序列级优势指标无法识别哪些词元级决策应被保留或修正。证据条件下的教师模型通过重放采样轨迹并提供特权反馈,能够给出更密集的监督信号。然而,无差别模仿可能导致格式或推理风格发生偏离任务成功的转移。我们提出**VERPO**(基于验证证据的正则化策略优化)框架,将证据视为策略修正的提案,同时保留结果优化目标。该方法将无证据的参考恢复与带符号的词元级证据修正进行分离。通过费舍尔证据对比,沿估计的证据存在方向衰减修正力度。停止词元级ZPD控制器根据局部奖励对齐度和费舍尔移动成本来调节接受程度,而参考通道独立于接受决策。在五个科学推理与工具使用任务中,每个主干网络上的最佳变体在平均得分上均超越了最强基线方法。平均得分在Qwen3-4B上从0.6826提升至0.6857,在Qwen3-8B上从0.6895提升至0.7058,在Llama-3.2-1B上从0.4751提升至0.5657。 ## 1 引言 基于可验证奖励的结果优化策略已成为提升语言模型推理行为的核心方法(Shao等, 2024 [1];DeepSeek-AI, 2025 [2];Yu等, 2025 [3])。在可验证奖励强化学习(RLVR)中,任务成功性可自动验证,使得策略更新能基于可靠的结果级反馈。组相对策略优化(GRPO)(Shao等, 2024 [1])通过多次在策略推演获得组相对优势,并利用该优势强化或抑制完整回复。该信号因直接关联最终任务成功而具有吸引力。然而,GRPO类方法将序列级优势均匀应用于所有回复词元。这种粗糙的信用分配在未识别局部决策优劣的情况下对整个回复进行强化或惩罚。 证据条件自蒸馏提供了互补的监督源。通过特权反馈重放采样轨迹,自教师模型无需部署学生访问证据即可提供密集词元级指导(Hübotter等, 2026 [8])。这解决了结果奖励稀疏性问题,但引入了新挑战:教师-学生差异并非自动等同于任务改进的修正。简单模仿证据条件教师分布可能转移证据诱导的格式化、置信度、冗余度或推理风格偏好,而非仅传递任务相关改进(Lazaridis等, 2026 [12];Harne等, 2026 [33])。当这些偏离与可验证任务成功未对齐时,可能导致学习不稳定(Kaur等, 2026 [14];Harne等, 2026 [33])。 这些观察表明,核心挑战并非简单组合RL损失与蒸馏损失。有效方法需分离三种通常纠缠的角色:定义任务改进的结果优化标准、提出局部策略变更的证据诱导方向、以及该变更在特定词元处是否值得接受的决策。由此引出问题:证据能否在保持从属于可验证奖励目标的前提下,为结果优化提供密集指导? 我们提出**VERPO**框架,将证据视为策略修正提案而非结果目标的替代品。VERPO将教师指导分解为:保留参考行为的无证据参考项,以及提议策略在每个词元处移动方向的带符号证据诱导修正。分解后,VERPO使用停止词元级控制器决定每项修正的接受程度。控制器通过对比修正与局部GRPO更新方向的对齐度及其费舍尔移动成本,确保证据指导在奖励对齐且整合成本低处发挥最大作用(参见图1说明)。 图1:左图:可验证RL依赖稀疏结果奖励,需要大量失败尝试的试错探索。右图:VERPO通过选择性局部修正和自适应指导增强结果信号,在保留基于奖励的改进同时,沿轨迹提供针对性监督。图1(https://arxiv.org/html/2609.06100#S1.F1)阐释了此动机。左图将标准可验证RL描述为由稀疏结果奖励驱动的试错探索:模型仅在生成完整回复后获得可靠反馈,许多中间推理决策缺乏支持。右图展示VERPO视角:证据沿轨迹提供局部修正提案,控制器自适应调节提案而非均匀应用。因此,VERPO以奖励优化为锚点,但在证据合理的位点添加针对性监督。 表1(https://arxiv.org/html/2609.06100#S1.T1)进一步总结VERPO与代表性替代方法的区别。GRPO(Shao等, 2024 [1])使用结果奖励且无需外部教师,但缺乏密集词元指导与词元级选择性。SDPO(Hübotter等, 2026 [8])提供无外部教师的密集自蒸馏指导,但未将修正锚定于可验证奖励,且在未验证奖励的词元级接受情况下应用教师偏好。VERPO结合二者优势:保留结果奖励信号、获取密集词元级证据指导,并引入经奖励验证的词元级选择修正。此对比突显VERPO并非GRPO与自蒸馏的加权求和;其将证据角色从监督目标转变为局部控制的修正提案。 表1:GRPO、SDPO、VERPO对比 我们通过多种证据方向构建实例化VERPO。Fix构建(Hübotter等, 2026 [8])对比证据条件教师与无证据教师,而对比构建(CTR)(Pan等, 2026 [16])对比正确与错误证据下的教师分布。我们进一步提出**费舍尔证据对比(FEC)**,该方法剔除与特权证据存在相关的冗余偏移。所得修正可通过两种更新路径应用:缩放证据蒸馏损失、调节词元级策略优势,或通过同一停止控制器同时进入两条路径。 我们在五个科学推理与工具使用任务中评估VERPO,使用Qwen3-4B(Yang等, 2025 [32])、Qwen3-8B(Yang等, 2025 [32])和Llama-3.2-1B(Meta, 2024 [34])。每个主干网络上的最佳VERPO变体在五任务平均分上均超过最强基线(完整非合并结果)。平均得分在Qwen3-4B上从0.6826提升至0.6857,在Qwen3-8B上从0.6895提升至0.7058,在Llama-3.2-1B上从0.4751提升至0.5657。这些是跨种子的无不确定性点估计。诊断分析描述了与控制器利用局部奖励对齐度和费舍尔移动成本相符的任务依赖性接受行为。 我们的贡献如下: - • 将RLVR的证据条件自蒸馏建模为分离问题,区分无证据参考保留与带符号证据诱导的策略修正。 - • 提出停止词元级控制器,根据局部奖励对齐度和费舍尔移动成本接受并缩放每项证据修正。 - • 实例化多种证据方向构建,包括剔除证据存在所致冗余偏移的费舍尔证据对比。 - • 在三种主干网络上报告高于GRPO(Shao等, 2024 [1])、SDPO(Hübotter等, 2026 [8])和SRPO(Li等, 2026 [9])的五任务平均分,并分析词元级修正的应用时机与位置。 ## 2 相关工作 #### RLVR与细粒度信用分配 可验证奖励强化学习(RLVR)使用自动可验证的结果奖励优化语言模型。无评论家方法如GRPO(Shao等, 2024 [1])用基于多次在策略回复的组相对优势替代传统演员-评论家价值估计。DeepSeek-R1(DeepSeek-AI, 2025 [2])和DAPO(Yu等, 2025 [3])使用相关组相对更新实现可扩展RLVR。这些序列级优势在回复词元间共享,掩盖了导致结果的局部决策。过程监督通过人工标注步骤验证(《Let’s Verify Step by Step》(Lightman等, 2024 [26]))、自动构建标签(Math-Shepherd(Wang等, 2024 [27]))以及结果衍生的进度估计(Rewarding Progress(Setlur等, 2025 [28]))获得更细粒度信号。此类方法需要人工标注或自动过程目标与学习验证器,其局部偏好未必匹配可验证的序列级目标。VERPO保留结果衍生的GRPO优势作为任务级锚点,利用特权教师重放提出词元级修正,仅在与局部奖励方向对齐且费舍尔移动成本合理时接受修正。 #### 在策略蒸馏与自蒸馏 知识蒸馏将教师的预测分布转移给学生(Hinton等, 2015 [4])。在策略蒸馏通过外部教师监督学生生成轨迹来减少离策略分布偏移(Agarwal等, 2023 [5])。MiniLLM为语言模型蒸馏开发了相关分布匹配公式(Gu等, 2023 [6])。OPSD通过相同模型在特权解决方案上的条件作用移除外部教师(Zhao等, 2026a [7]),SDPO构建反馈条件自教师提供密集词元级监督(Hübotter等, 2026 [8])。SRPO(Li等, 2026 [9])通过样本级路由将自蒸馏锚定于可验证结果。EviSD(Xie等, 2026 [10])对证据条件搜索动作应用奖励锚定调制。这些方法未联合分离无证据参考保留与带符号证据诱导改变,也未决定单个修正在局部策略成本下是否值得应用。VERPO通过停止词元级ZPD控制器解决此控制缺口,根据修正与局部GRPO方向的对齐度及其费舍尔移动成本接受并缩放每项修正。 #### 选择性与对比性特权监督 经验研究表明特权监督在推演或词元间并非均匀可靠(Armandpour等, 2026 [11];Harne等, 2026 [33];Lazaridis等, 2026 [12];Zhao等, 2026b [13];Kaur等, 2026 [14];Jiang等, 2026 [15])。教师指导在错误轨迹上比在已正确轨迹上更对齐(Armandpour等, 2026 [11]),而特权条件作用可能使教师偏向特定参考轨迹而非普遍正确性(Harne等, 2026 [33]),诱导与预期修正无关的行为(Lazaridis等, 2026 [12]),覆盖有效推理前缀(Zhao等, 2026b [13]),抑制思维模型中的验证与回溯(Kaur等, 2026 [14]),或放大弱输入基础信号(Jiang等, 2026 [15])。CEPO(Heakl等, 2026 [17])利用正确-错误证据进行对比词元信用,OCSD(Yang等, 2026 [18])使用结构匹配的特权与消融重放视图移除智能体RL中的重放支架效应。这些对比构建减少了特权分支间的共享效应,但教师差异仍可能包含由特权证据存在导致的成分。该成分可能将证据特有的风格、置信度或格式渗入学生而不提升任务成功。VERPO的费舍尔证据对比(FEC)在局部费舍尔度量下估计此证据存在方向并将其从任务对比中剔除,从而在应用修正前减少特权上下文渗漏。 ## 3 方法 VERPO分离参考恢复、证据修正与词元级接受。无证据教师锚定演员行为,教师比较提出带符号修正,停止ZPD权重控制其贡献。
相似文章
超越稳定性-探索困境:LLM策略优化的环境正则化
本文介绍了ERPO,一种通过控制查询分布将正则化从动作侧转移到输入侧的方法,解决了LLM策略优化中的稳定性-探索困境,并在数学推理基准测试中展示了改进。
CEPO:基于对比证据策略优化的RLVR自我蒸馏
CEPO通过使用来自拒绝轨迹的对比信号来区分关键推理步骤和填充令牌,从而改进了基于可验证奖励的强化学习,在多模态数学推理基准上相比GRPO获得了更高的准确率。
LambdaPO: 面向推理语言模型的Lambda风格策略优化
引入LambdaPO,一种新颖的强化学习框架,它通过将优势估计分解为成对偏好比较并添加语义密度奖励来改进GRPO,从而在数学推理任务上取得了更好的性能。
SERPO:面向开放式测试时强化学习的自演化评分策略优化
SERPO 提出了一种自演化评分策略优化框架,用于开放式生成中的测试时强化学习,用闭环替代答案投票,该闭环协同进化响应证据、查询特定评分标准和策略参数,在健康和研究基准上取得了显著改进。
基于变分学习的RLVR参数探索
本文介绍了扰动参数策略优化(3PO),这是一种用于LLM强化学习的参数空间探索方法族,展示了在数学和代码任务上相较于GRPO的一致改进。