Best Practice Critic Optimization

Hugging Face Daily Papers 论文

摘要

BPCO 引入了一种稳定的配方,用于语言模型中基于评论者的强化学习,结合有界价值预测和蒙特卡洛目标,以单响应采样匹配基于组的方法。

基于组的强化学习方法,如 GRPO,用于大型语言模型,通过为每个提示采样多个响应来避免训练评论者。一个可靠的评论者可以转而从单个响应估计令牌级别的优势,但标准的基于评论者的训练配方往往不稳定。我们研究了这种不稳定性,并开发了 **Best Practice Critic Optimization (BPCO)**,一种结合了 DPPO、有界于奖励范围的价值预测、蒙特卡洛价值目标、未归一化的策略优势和长度自适应广义优势估计的配方。由于评论者仅在训练期间使用,BPCO 还可以根据奖励定义信息(如参考答案或评分标准)对其进行条件化,这些信息对策略隐藏。对照实验隔离了每个设计选择的效果。在涵盖从 1.5B 参数到 30B-A3B 专家混合模型的数学推理任务中,BPCO 一致地改进了一个强大的基于评论者的基线,并在每个提示采样一个响应时匹配或超越了基于组的基线。相同的配方还改进了基于评分标准奖励的学习。这些结果表明,一个精心设计的评论者提供了一种可靠的替代方案,用于组相对优势估计。代码可在 https://github.com/QPHutu/golden_critic 获取。
查看原文
查看缓存全文

缓存时间: 2026/08/26 03:15

论文页面 - 最佳实践评论家优化

来源:https://huggingface.co/papers/2608.23566

摘要

BPCO通过结合有界价值预测、蒙特卡洛目标与自适应优势估计,稳定了基于评论家的大语言模型强化学习训练,仅需单次响应采样即可达到基于群组的方法的性能。

基于群组的强化学习方法(如GRPO (https://huggingface.co/papers?q=GRPO))通过对每个提示采样多个响应来避免训练评论家。一个可靠的评论家本可以从单个响应中估计令牌级优势 (https://huggingface.co/papers?q=token-level%20advantages),但标准的基于评论家的训练方案通常不稳定。我们研究了这种不稳定性,并开发了最佳实践评论家优化 (https://huggingface.co/papers?q=Critic%20Optimization) (BPCO),这是一种结合了DPPO (https://huggingface.co/papers?q=DPPO)、有界于奖励范围的价值预测 (https://huggingface.co/papers?q=value%20predictions)、蒙特卡洛价值目标 (https://huggingface.co/papers?q=Monte%20Carlo%20value%20targets)、未归一化策略优势以及长度自适应广义优势估计 (https://huggingface.co/papers?q=generalized%20advantage%20estimation) 的方案。由于评论家仅在训练期间使用,BPCO还可以使其基于奖励定义信息(如参考答案或评分标准)进行条件判断,而这些信息对策略是隐藏的。对照实验分离了每个设计选择的影响。在涉及从15亿参数到30B-A3B混合专家模型的多项数学推理任务中,BPCO持续改进了一个强大的基于评论家的基线,并在每个提示仅采样一个响应的情况下匹配或超越了基于群组的基线。相同的方案也改进了基于标准 (https://huggingface.co/papers?q=rubric-based%20rewards) 奖励的学习。这些结果表明,精心设计的评论家提供了一种可靠的替代方案,可用于基于群组的相对优势估计。代码可在 https://github.com/QPHutu/golden_critic 获取。

查看arXiv页面 (https://arxiv.org/abs/2608.23566) 查看PDF (https://arxiv.org/pdf/2608.23566) GitHub (https://github.com/QPHutu/golden_critic) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.23566)

通过你的代理获取此论文:

hf papers read 2608\.23566

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型链接此论文

在模型README.md中引用 arxiv.org/abs/2608.23566 以从本页面链接它。

引用此论文的数据集0

无数据集链接此论文

在数据集README.md中引用 arxiv.org/abs/2608.23566 以从本页面链接它。

引用此论文的Spaces0

无Space链接此论文

在Space README.md中引用 arxiv.org/abs/2608.23566 以从本页面链接它。

包含此论文的收藏集0

无收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面链接它。

相似文章

Contrastive Branch Policy Optimization

arXiv cs.LG

CBPO引入了一种对比分支策略优化方法,用于具有可验证奖励的强化学习中的细粒度信用分配,提升了语言模型在多个基准测试中集成工具的推理任务的性能。

面向进度与可靠性的智能体强化学习组策略优化

arXiv cs.AI

ProGPO是一种免学习评论器的方法,用于LLM智能体基于组的RL中的步骤级优势估计,它使用精确前缀动作比较和基于rollout的状态势,以改善长视界任务上的信用分配。在ALFWorld和WebShop上使用Qwen2.5模型的实验表明,它优于现有的智能体RL基线。