Best Practice Critic Optimization
摘要
BPCO 引入了一种稳定的配方,用于语言模型中基于评论者的强化学习,结合有界价值预测和蒙特卡洛目标,以单响应采样匹配基于组的方法。
查看缓存全文
缓存时间: 2026/08/26 03:15
论文页面 - 最佳实践评论家优化
来源:https://huggingface.co/papers/2608.23566
摘要
BPCO通过结合有界价值预测、蒙特卡洛目标与自适应优势估计,稳定了基于评论家的大语言模型强化学习训练,仅需单次响应采样即可达到基于群组的方法的性能。
基于群组的强化学习方法(如GRPO (https://huggingface.co/papers?q=GRPO))通过对每个提示采样多个响应来避免训练评论家。一个可靠的评论家本可以从单个响应中估计令牌级优势 (https://huggingface.co/papers?q=token-level%20advantages),但标准的基于评论家的训练方案通常不稳定。我们研究了这种不稳定性,并开发了最佳实践评论家优化 (https://huggingface.co/papers?q=Critic%20Optimization) (BPCO),这是一种结合了DPPO (https://huggingface.co/papers?q=DPPO)、有界于奖励范围的价值预测 (https://huggingface.co/papers?q=value%20predictions)、蒙特卡洛价值目标 (https://huggingface.co/papers?q=Monte%20Carlo%20value%20targets)、未归一化策略优势以及长度自适应广义优势估计 (https://huggingface.co/papers?q=generalized%20advantage%20estimation) 的方案。由于评论家仅在训练期间使用,BPCO还可以使其基于奖励定义信息(如参考答案或评分标准)进行条件判断,而这些信息对策略是隐藏的。对照实验分离了每个设计选择的影响。在涉及从15亿参数到30B-A3B混合专家模型的多项数学推理任务中,BPCO持续改进了一个强大的基于评论家的基线,并在每个提示仅采样一个响应的情况下匹配或超越了基于群组的基线。相同的方案也改进了基于标准 (https://huggingface.co/papers?q=rubric-based%20rewards) 奖励的学习。这些结果表明,精心设计的评论家提供了一种可靠的替代方案,可用于基于群组的相对优势估计。代码可在 https://github.com/QPHutu/golden_critic 获取。
查看arXiv页面 (https://arxiv.org/abs/2608.23566) 查看PDF (https://arxiv.org/pdf/2608.23566) GitHub (https://github.com/QPHutu/golden_critic) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.23566)
通过你的代理获取此论文:
hf papers read 2608\.23566
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型链接此论文
在模型README.md中引用 arxiv.org/abs/2608.23566 以从本页面链接它。
引用此论文的数据集0
无数据集链接此论文
在数据集README.md中引用 arxiv.org/abs/2608.23566 以从本页面链接它。
引用此论文的Spaces0
无Space链接此论文
在Space README.md中引用 arxiv.org/abs/2608.23566 以从本页面链接它。
包含此论文的收藏集0
无收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面链接它。
相似文章
Contrastive Branch Policy Optimization
CBPO引入了一种对比分支策略优化方法,用于具有可验证奖励的强化学习中的细粒度信用分配,提升了语言模型在多个基准测试中集成工具的推理任务的性能。
你的语言模型就是其自身的评论者:利用演员内部状态进行价值估计的强化学习
本文介绍了 POISE,一种通过利用模型自身内部状态来估计基线,从而在大型推理模型中实现稳定策略优化的方法,与 PPO 和 GRPO 相比,该方法降低了计算开销。
BV-Blend: 不确定性加权历史基线用于可验证奖励下稳定无评论家强化学习
BV-Blend是一种无评论家的强化学习框架,它将提示本地在线策略统计与来自语义聚类的历史矩相结合,以稳定优势估计,从而提高使用可验证奖励对齐大型语言模型的训练稳定性和性能。
Good Rankers, Bad Objectives: Bilinear Contrastive Critics under Expressive Policy Search
This paper analyzes contrastive critics used as value-like objectives in reinforcement learning, showing that good ranking accuracy does not make them safe to maximize due to off-support norm inflation and misranking, and demonstrates that value-calibrated scalar critics like TD-Q succeed where contrastive critics fail.
面向进度与可靠性的智能体强化学习组策略优化
ProGPO是一种免学习评论器的方法,用于LLM智能体基于组的RL中的步骤级优势估计,它使用精确前缀动作比较和基于rollout的状态势,以改善长视界任务上的信用分配。在ALFWorld和WebShop上使用Qwen2.5模型的实验表明,它优于现有的智能体RL基线。