PACT:从信用分配到评论家对齐

Hugging Face Daily Papers 论文

摘要

该论文为大型语言模型强化学习中的令牌级信用制定了正则条件,并介绍了策略对齐评论家训练(PACT),该方法在数学推理和编码基准测试中优于GRPO和PPO。

强化学习已成为大型语言模型(LLM)后训练的核心组成部分,但令牌级信用缺乏普遍接受的数学定义,导致其与常用训练信号的关系不明。我们制定了三个正则条件,即完整性、前缀一致性和中立性,并证明它们唯一确定令牌级信用。这一表征为解释现有算法中的现象提供了统一基础,并指导了改进的行动者-评论家训练程序的开发。通过这一视角,在线策略蒸馏(OPD)中的理想教师充当隐式评论家,产生的期望策略梯度与令牌级信用诱导的成比例。响应级REINFORCE留一法(RLOO)信号尽管粒度较粗,但与令牌级信用的期望策略梯度贡献相匹配。我们进一步建立了在有界结果奖励下的近似信用稀疏性,并展示了广义优势估计(GAE)中的中间评论家错误如何变得与底层信用相当。这些促使了策略对齐评论家训练(PACT),该方法采用先行动者后评论家的更新顺序,对评论家训练应用重要性采样校正,以更好地将评论家与更新后的策略对齐。在代理数学推理中,PACT在四个基准测试中平均准确率达到72.87%,分别优于GRPO和PPO 8.80和13.16个百分点。在SWE-bench Verified上,PACT达到67.4%的通过率,分别优于PPO、GRPO和SAO 2.4、2.0和3.8个百分点。
查看原文
查看缓存全文

缓存时间: 2026/09/24 03:38

论文页面 - PACT:从信用分配到评论家对齐

来源:https://huggingface.co/papers/2609.26355

摘要

强化学习已成为大型语言模型(LLM)后训练的核心组成部分,但标记级别的信用分配缺乏普遍接受的数学定义,导致其与常用训练信号的关系不明确。我们制定了三个正则条件,即完整性、前缀一致性和中立性,并证明它们唯一确定了标记级别的信用分配。这一特性为解释现有算法中的现象提供了统一基础,并指导了改进的演员-评论家训练流程的开发。通过这一视角,在策略内蒸馏(OPD)中理想的教师充当隐式评论家,产生的期望策略梯度与由标记级别信用分配诱导的梯度成比例。响应级别的REINFORCE留一法(RLOO)信号尽管粒度较粗,但与标记级别信用分配的期望策略梯度贡献相匹配。我们进一步在有界结果奖励下建立了近似信用稀疏性,并展示了广义优势估计(GAE)中的中间评论家误差如何可能与底层信用分配相当。这启发了策略对齐评论家训练(PACT),它采用演员-然后-评论家的更新顺序,对评论家训练应用重要性采样校正,使评论家与更新后的策略更好对齐。在代理数学推理任务中,PACT在四个基准测试上平均准确率达到72.87%,分别比GRPO和PPO高出8.80和13.16个百分点。在SWE-bench验证集上,PACT达到67.4%的通过率,分别比PPO、GRPO和SAO高出2.4、2.0和3.8个百分点。

查看 arXiv 页面 (https://arxiv.org/abs/2609.26355)查看 PDF (https://arxiv.org/pdf/2609.26355)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.26355)

获取此论文到你的代理:

hf papers read 2609\.26355

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型的 README.md 中引用 arxiv.org/abs/2609.26355 以从此页面链接它。

引用此论文的数据集0

没有数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2609.26355 以从此页面链接它。

引用此论文的 Space0

没有 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2609.26355 以从此页面链接它。

包含此论文的收藏夹1

相似文章

用于离散策略优化的引导对比Token信用分配

Hugging Face Daily Papers

本文提出引导对比策略优化(GCPO),这是一种新颖的算法,通过对比正负提示下的模型预测,在强化学习中实现每个Token的信用分配,在文本到图像生成和思维链推理基准测试中持续优于GRPO和DAPO基线。

超越LLM强化学习中的统一令牌级信任区域

Hugging Face Daily Papers

本文介绍了CPPO,这是一种通过使用位置加权阈值和累积前缀预算来改进基于可验证奖励的LLM强化学习方法,旨在解决统一令牌级信任区域的局限性。