PACT:从信用分配到评论家对齐
摘要
该论文为大型语言模型强化学习中的令牌级信用制定了正则条件,并介绍了策略对齐评论家训练(PACT),该方法在数学推理和编码基准测试中优于GRPO和PPO。
查看缓存全文
缓存时间: 2026/09/24 03:38
论文页面 - PACT:从信用分配到评论家对齐
来源:https://huggingface.co/papers/2609.26355
摘要
强化学习已成为大型语言模型(LLM)后训练的核心组成部分,但标记级别的信用分配缺乏普遍接受的数学定义,导致其与常用训练信号的关系不明确。我们制定了三个正则条件,即完整性、前缀一致性和中立性,并证明它们唯一确定了标记级别的信用分配。这一特性为解释现有算法中的现象提供了统一基础,并指导了改进的演员-评论家训练流程的开发。通过这一视角,在策略内蒸馏(OPD)中理想的教师充当隐式评论家,产生的期望策略梯度与由标记级别信用分配诱导的梯度成比例。响应级别的REINFORCE留一法(RLOO)信号尽管粒度较粗,但与标记级别信用分配的期望策略梯度贡献相匹配。我们进一步在有界结果奖励下建立了近似信用稀疏性,并展示了广义优势估计(GAE)中的中间评论家误差如何可能与底层信用分配相当。这启发了策略对齐评论家训练(PACT),它采用演员-然后-评论家的更新顺序,对评论家训练应用重要性采样校正,使评论家与更新后的策略更好对齐。在代理数学推理任务中,PACT在四个基准测试上平均准确率达到72.87%,分别比GRPO和PPO高出8.80和13.16个百分点。在SWE-bench验证集上,PACT达到67.4%的通过率,分别比PPO、GRPO和SAO高出2.4、2.0和3.8个百分点。
查看 arXiv 页面 (https://arxiv.org/abs/2609.26355)查看 PDF (https://arxiv.org/pdf/2609.26355)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.26355)
获取此论文到你的代理:
hf papers read 2609\.26355
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2609.26355 以从此页面链接它。
引用此论文的数据集0
没有数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2609.26355 以从此页面链接它。
引用此论文的 Space0
没有 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2609.26355 以从此页面链接它。
包含此论文的收藏夹1
相似文章
当不可信令牌被强化:面向大语言模型强化学习的尾部感知信用校准
提出尾部感知信用校准(TACO),通过校准统一信用分配以抑制对不可信尾部令牌的更新,解决大语言模型强化学习中的正向信用污染问题,提升训练稳定性和性能。
用于离散策略优化的引导对比Token信用分配
本文提出引导对比策略优化(GCPO),这是一种新颖的算法,通过对比正负提示下的模型预测,在强化学习中实现每个Token的信用分配,在文本到图像生成和思维链推理基准测试中持续优于GRPO和DAPO基线。
ACPO:基于细粒度替代熵的自适应信用策略优化
介绍了ACPO,一种用于大型语言模型强化学习的token级信用分配框架,利用细粒度替代熵提升数学和编码基准的推理性能,优于DAPO、GTPO、SAPO等强基线。
LambdaPO: 面向推理语言模型的Lambda风格策略优化
引入LambdaPO,一种新颖的强化学习框架,它通过将优势估计分解为成对偏好比较并添加语义密度奖励来改进GRPO,从而在数学推理任务上取得了更好的性能。
超越LLM强化学习中的统一令牌级信任区域
本文介绍了CPPO,这是一种通过使用位置加权阈值和累积前缀预算来改进基于可验证奖励的LLM强化学习方法,旨在解决统一令牌级信任区域的局限性。