ACPO:基于细粒度替代熵的自适应信用策略优化
摘要
介绍了ACPO,一种用于大型语言模型强化学习的token级信用分配框架,利用细粒度替代熵提升数学和编码基准的推理性能,优于DAPO、GTPO、SAPO等强基线。
arXiv:2607.03126v1 公告类型:新提交
摘要:强化学习(RL)已显著提升大型语言模型(LLM)的推理能力,但稀疏的结果奖励仍使得token级别的信用分配变得困难。现有的可扩展RL方法通常将轨迹级奖励均匀分配给各个token,而近期基于熵的方法要么依赖粗粒度的分离启发式方法,要么直接优化真实熵,这可能引入与采样token策略更新不一致的非局部梯度分量。我们提出自适应信用策略优化(ACPO),一种基于模态局部替代熵的token级信用分配框架。ACPO通过强调成功轨迹中的不确定决策和失败轨迹中的过度自信token,非对称地调节策略更新。我们证明该替代熵具有确定性熵界,并且在模态对齐和近端更新下,可保留策略梯度方向至首阶。在数学推理和编码基准(包括AIME 2025和HumanEvalPro)上的实验表明,ACPO始终优于DAPO、GTPO和SAPO等强RL基线。
查看缓存全文
缓存时间: 2026/07/07 04:41
# ACPO:基于细粒度代理熵的自适应信用策略优化
来源:[https://arxiv.org/html/2607.03126](https://arxiv.org/html/2607.03126)
谢子俊¹²,游宇阳¹³,李永志³,龚恩磊²,陈泽宇²,陈全³,程彦华³,江鹏³,穆亚东¹
¹北京大学 ²百度股份有限公司 ³快手科技
###### 摘要
强化学习(RL)显著提升了大语言模型(LLM)的推理能力,但稀疏的结果奖励仍使词元级别的信用分配变得困难。现有的可扩展RL方法通常将轨迹级别的奖励均匀分配给所有词元,而近期基于熵的方法要么依赖粗粒度的分离启发式策略,要么直接优化真实熵,这可能会引入与采样词元策略更新不一致的非局部梯度分量。我们提出自适应信用策略优化(ACPO),一种基于模态局部代理熵的词元级信用分配框架。ACPO通过不对称地调节策略更新,在成功轨迹中强调不确定的决策,在失败轨迹中惩罚过度自信的词元。我们证明该代理熵具有确定性的熵界,并且在模态对齐和近端更新的条件下,能够保留主阶的策略梯度方向。在数学推理和代码基准测试(包括AIME 2025和HumanEvalPro)上的实验表明,ACPO相比DAPO、GTPO和SAPO等强RL基线性能持续提升。
## 1 引言
近期大语言模型(LLM)推理的进展越来越依赖于对监督微调(SFT)模型应用强化学习(RL),特别是在数学和代码等具有可验证目标的领域 [DeepSeek-AI等人,2025 (https://arxiv.org/html/2607.03126#bib.bib21);Yang等人,2024b (https://arxiv.org/html/2607.03126#bib.bib36), 2025 (https://arxiv.org/html/2607.03126#bib.bib37), a (https://arxiv.org/html/2607.03126#bib.bib75);Dubey等人,2024 (https://arxiv.org/html/2607.03126#bib.bib65)]。SFT主要模仿示范 [Zhang等人,2023 (https://arxiv.org/html/2607.03126#bib.bib23);Ouyang等人,2022 (https://arxiv.org/html/2607.03126#bib.bib64);Dubey等人,2024 (https://arxiv.org/html/2607.03126#bib.bib65)],而RL使模型能够通过探索进行改进 [Zelikman等人,2022 (https://arxiv.org/html/2607.03126#bib.bib70);Shao等人,2024 (https://arxiv.org/html/2607.03126#bib.bib62);Zhang等人,2025 (https://arxiv.org/html/2607.03126#bib.bib38)]。这一方向的一个关键进展是可验证奖励强化学习(RLVR) [Sheng等人,2025 (https://arxiv.org/html/2607.03126#bib.bib43);Yue等人,2025 (https://arxiv.org/html/2607.03126#bib.bib39);Chen等人,2025 (https://arxiv.org/html/2607.03126#bib.bib26)]。与依赖主观且成本高昂的人类偏好的传统RLHF [Schulman等人,2017 (https://arxiv.org/html/2607.03126#bib.bib61);Ouyang等人,2022 (https://arxiv.org/html/2607.03126#bib.bib64)]不同,RLVR利用客观、确定性的信号(例如编译器结果或数学验证器)进行大规模训练,无需人工在环瓶颈 [Sheng等人,2025 (https://arxiv.org/html/2607.03126#bib.bib43);Zheng等人,2025 (https://arxiv.org/html/2607.03126#bib.bib29);Cobbe等人,2021 (https://arxiv.org/html/2607.03126#bib.bib66)]。这一转变的核心是组相对策略优化(GRPO) [Shao等人,2024 (https://arxiv.org/html/2607.03126#bib.bib62)]。通过使用组内相对奖励且无需单独的价值网络,GRPO显著降低了RL训练的计算门槛 [DeepSeek-AI等人,2025 (https://arxiv.org/html/2607.03126#bib.bib21);Bai等人,2025 (https://arxiv.org/html/2607.03126#bib.bib22)]。然而,尽管效率很高,GRPO及类似的基于结果的方法 [Zhao等人,2025 (https://arxiv.org/html/2607.03126#bib.bib27);Li等人,2025 (https://arxiv.org/html/2607.03126#bib.bib31)]面临一个关键限制:奖励信号的稀疏性。在长思维链(CoT)轨迹 [Wei等人,2022 (https://arxiv.org/html/2607.03126#bib.bib63)]中,标量结果通常只在最后可得。将这个粗粒度的信号不加区分地分配给所有词元——忽略它们对正确或错误推理路径的各自贡献——可能会引入显著的方差和训练不稳定性 [Guo等人,2025b (https://arxiv.org/html/2607.03126#bib.bib30);Zhu等人,2025 (https://arxiv.org/html/2607.03126#bib.bib32)]。
为了缓解这个信用分配问题,出现了两条主要路径。第一条依赖过程奖励模型(PRM) [Lightman等人,2023 (https://arxiv.org/html/2607.03126#bib.bib81);Cui等人,2025 (https://arxiv.org/html/2607.03126#bib.bib25)]来提供密集的、逐步的反馈。PRM虽然有效,但受到高昂的标注成本和可扩展性问题的阻碍 [Lightman等人,2023 (https://arxiv.org/html/2607.03126#bib.bib81)]。第二条路径是我们所遵循的,即追求隐式算法信用分配。早期方法如DAPO [Yu等人,2025 (https://arxiv.org/html/2607.03126#bib.bib28)]和SAPO [Gao等人,2025 (https://arxiv.org/html/2607.03126#bib.bib3)]基于结果优势使用非对称裁剪或软门控来调节策略更新 [Wang等人,2025a (https://arxiv.org/html/2607.03126#bib.bib33);Chen等人,2025 (https://arxiv.org/html/2607.03126#bib.bib26);Xie等人,2025 (https://arxiv.org/html/2607.03126#bib.bib35)]。认识到纯结果指标忽略了模型内部状态,近期工作探索词元熵(或预测不确定性)作为重要性代理,假设高不确定性词元对应关键的推理“分叉点” [Wang等人,2025b (https://arxiv.org/html/2607.03126#bib.bib41);Huang等人,2025 (https://arxiv.org/html/2607.03126#bib.bib42);Tang等人,2025 (https://arxiv.org/html/2607.03126#bib.bib82)]。然而,现有的基于熵的方法仍然面临两个关键限制。首先,一些方法依赖启发式的“硬桶”,例如统一处理前20%最高熵的词元,这可能缺乏复杂推理所需的粒度 [Hao等人,2025 (https://arxiv.org/html/2607.03126#bib.bib34);Wang等人,2025b (https://arxiv.org/html/2607.03126#bib.bib41)]。其次,将真实熵直接整合到优化目标中可能会引入优化不匹配。正如我们在第4.3节 (https://arxiv.org/html/2607.03126#S4.SS3)中分析的,真实熵贡献了一个全分布的梯度分量,该分量不一定与采样词元策略更新对齐,并可能引入噪声或竞争性的更新信号 [Liu等人,2025 (https://arxiv.org/html/2607.03126#bib.bib40)]。此外,即使熵被分离并仅用作标量权重,全词表的熵仍然对尾分布噪声敏感,这促使需要一个更模态本地的替代项。
为了应对这些挑战,我们提出**自适应信用策略优化(ACPO)**。我们的贡献如下:
- • **细粒度自适应信用分配**。我们引入了一种词元级加权方案,动态调整优势估计。我们不对称地处理正优势和非正优势轨迹:在成功轨迹中强调不确定的决策,同时在失败轨迹中惩罚过度自信的词元。
- • **代理熵公式**。我们识别出直接使用真实熵进行信用分配时出现的优化不匹配。为了解决这个问题,我们提出了一种模态局部代理熵公式。我们证明该代理熵具有确定性的熵界,并且在经验观察到的模态对齐和近端更新状态下,产生一个保持预期策略梯度方向的主阶调节项。
- • **实证有效性**。我们在三个基础模型(包括Qwen2.5-Math-7B、DeepSeek-R1-Distill和Qwen3-8B-Base)上,在具有竞争力的推理基准上验证了ACPO。ACPO始终优于强RL基线,包括GRPO、DAPO和SAPO,展示了在稀疏结果监督下基于代理熵的信用分配的有效性。
## 2 相关工作
### 2.1 从RLHF到RLVR
传统RLHF通常依赖PPO [Ouyang等人,2022 (https://arxiv.org/html/2607.03126#bib.bib64);Schulman等人,2017 (https://arxiv.org/html/2607.03126#bib.bib61)]或无需评论家的偏好学习方法如DPO [Rafailov等人,2023 (https://arxiv.org/html/2607.03126#bib.bib50)]。然而,对齐推理模型越来越倾向于客观、可验证的结果监督。这一转变的核心是组相对策略优化(GRPO) [Shao等人,2024 (https://arxiv.org/html/2607.03126#bib.bib62);Guo等人,2025a (https://arxiv.org/html/2607.03126#bib.bib2)],它用采样输出的平均奖励替代评论家网络,并支持高效的迭代训练。近期变体进一步稳定了这一范式:DAPO [Yu等人,2025 (https://arxiv.org/html/2607.03126#bib.bib28)]采用解耦裁剪进行大规模更新,而SAPO [Gao等人,2025 (https://arxiv.org/html/2607.03126#bib.bib3)]引入了一个软性的、温度控制的门控机制来处理离策略数据。我们的工作直接建立在SAPO公式之上,通过内在不确定性信号扩展其序列级门控,实现细粒度的词元级信用分配。
### 2.2 信用分配瓶颈
推理任务中的一个持续挑战是“信用分配”问题——确定推理链中哪些具体步骤导致了最终结果 [Guo等人,2025b (https://arxiv.org/html/2607.03126#bib.bib30);Zhang等人,2025 (https://arxiv.org/html/2607.03126#bib.bib38)]。
**使用PRM的显式监督**。过程奖励模型(PRM)通过评分单个推理步骤提供密集反馈,并且可以在推理任务中优于结果奖励模型(ORM) [Lightman等人,2023 (https://arxiv.org/html/2607.03126#bib.bib81);Cui等人,2025 (https://arxiv.org/html/2607.03126#bib.bib25)]。然而,训练PRM通常需要昂贵的人工密集标注或复杂的自动化验证器 [Hendrycks等人,2021 (https://arxiv.org/html/2607.03126#bib.bib47);Cobbe等人,2021 (https://arxiv.org/html/2607.03126#bib.bib66)]。
**隐式算法监督**。为了在没有高昂标注成本的情况下提供更细粒度的监督,研究人员转向了隐式信号。像CISPO [Chen等人,2025 (https://arxiv.org/html/2607.03126#bib.bib26)]和BAPO [Xie等人,2025 (https://arxiv.org/html/2607.03126#bib.bib35)]这样的方法引入了粒度约束来在词元级别调节生成。其他方法利用梯度范数或似然比来动态估计词元重要性 [Li等人,2025 (https://arxiv.org/html/2607.03126#bib.bib31);Zhao等人,2025 (https://arxiv.org/html/2607.03126#bib.bib27)]。
### 2.3 熵感知强化学习
熵已广泛应用于基于RL的语言模型对齐中。一条工作线将熵用作观察信号。诸如“80/20规则” [Wang等人,2025b (https://arxiv.org/html/2607.03126#bib.bib41)]、Archer [Huang等人,2025 (https://arxiv.org/html/2607.03126#bib.bib42)]、A3PO [Tang等人,2025 (https://arxiv.org/html/2607.03126#bib.bib82)]和GTPO [Simoni等人,2025 (https://arxiv.org/html/2607.03126#bib.bib19)]等方法利用策略熵来识别不确定的词元、重新加权优势或过滤补全。虽然有效,但这些方法通常将熵视为一个分离的启发式信号,而非可微的优化目标。
另一条工作线直接将熵正则化添加到策略目标中,如PPO风格的熵奖励 [Schulman等人,2017 (https://arxiv.org/html/2607.03126#bib.bib61)]。在自回归LLM中,该熵定义在每个解码步骤的下一个词元分布上。然而,它通常通过一个全局系数聚合,作为通用的探索正则化器,而非奖励感知的词元级信用信号。此外,直接优化真实熵可能会引入非局部的梯度分量,这些分量不一定与采样词元策略更新对齐,我们在第4.3节 (https://arxiv.org/html/2607.03126#S4.SS3)中详细阐述。
ACPO结合了这两个方向的方面:使用词元级不确定性进行细粒度信用分配,同时用模态局部代理熵替换全词表熵。这种设计能够实现非对称更新,在正优势轨迹中强调不确定词元,在非正优势轨迹中惩罚过度自信的词元。
## 3 预备知识
**符号**。令 \(\pi_\theta\) 为一个随机策略,它将查询(提示) \(\mathbf{q}\) 映射到响应 \(\mathbf{y}\)。生成长度为 \(|\mathbf{y}|\) 的响应 \(\mathbf{y}\) 的可能性为:
\[\pi_\theta(\mathbf{y}|\mathbf{q}) = \prod_{t=1}^{|\mathbf{y}|} \pi_\theta(y_t|\mathbf{q}, y_{<t}).\]
**组相对策略优化(GRPO)**。GRPO从旧策略 \(\pi_{\theta_{\text{old}}}\) 中采样一组 \(G\) 个响应 \(\{\mathbf{y}_i\}_{i=1}^G\),并使用基于组的奖励来定义优势。对于第 \(i\) 个响应中的第 \(t\) 个词元,优势估计为:
\[\hat{A}_{i,t} = \frac{R(\mathbf{y}_i) - \mu}{\sigma},\]
其中 \(\mu = \frac{1}{G} \sum_{j=1}^G R(\mathbf{y}_j)\),\(\sigma = \text{std}(\{R(\mathbf{y}_j)\}_{j=1}^G)\)。GRPO最大化以下目标:
\[\mathcal{J}_{\text{GRPO}}(\theta) = \frac{1}{G} \sum_{i=1}^G \frac{1}{|\mathbf{y}_i|} \sum_{t=1}^{|\mathbf{y}_i|} \left[ \min\left( \frac{\pi_\theta(y_{i,t}|\mathbf{q}, y_{i,<t})}{\pi_{\theta_{\text{old}}}(y_{i,t}|\mathbf{q}, y_{i,<t})} \hat{A}_{i,t}, \text{clip}\left( \frac{\pi_\theta(\cdot)}{\pi_{\theta_{\text{old}}}(\cdot)}, 1-\epsilon, 1+\epsilon \right) \hat{A}_{i,t} \right) \right].\]
**SAPO:软对齐策略优化**。SAPO [Gao等人,2025 (https://arxiv.org/html/2607.03126#bib.bib3)] 引入了一个温度控制的软门控来过滤离策略数据:
\[\mathcal{J}_{\text{SAPO}}(\theta) = \frac{1}{G} \sum_{i=1}^G f_i \cdot \frac{1}{|\mathbf{y}_i|} \sum_{t=1}^{|\mathbf{y}_i|} \mathcal{L}_t(\pi_\theta, \hat{A}_{i,t}),\]
其中 \(f_i = \sigma(\tau (R(\mathbf{y}_i) - R_0))\) 是一个软过滤权重,\(R_0\) 是一个阈值。在本文中,我们使用 \(R_0 = \mu + \kappa \sigma\),其中 \(\kappa\) 控制严格性。
**词元熵**。在自回归LLM中,第 \(t\) 步的预测不确定性通过条件熵来衡量:
\[H_t(\theta) = -\sum_{v \in \mathcal{V}} \pi_\theta(v | \mathbf{q}, \mathbf{y}_{<t}) \log \pi_\theta(v | \mathbf{q}, \mathbf{y}_{<t}),\]
其中 \(\mathcal{V}\) 是词表。高熵指示低置信度,低熵指示高置信度。我们将采样后的概率定义为:
\[p_{i,t}^* = \pi_{\theta_{\text{old}}}(y_{i,t} | \mathbf{q}, y_{i,<t}),\]
这是模型赋予已采样词元的概率。为简单起见,我们定义模态归一化后的采样概率和最大概率:
- 归一化采样概率:\(\dot{p}_{i,t} = \frac{p_{i,t}^*}{p_{i,t}^{\text{max}}}\),
- 归一化最大概率:\(\dot{p}_{i,t}^{\text{max}} = \frac{p_{i,t}^{\text{max}}}{p_{i,t}^{\text{sum}}}\),
其中 \(p_{i,t}^{\text{max}} = \max_v \pi_{\theta_{\text{old}}}(v | \cdot)\),\(p_{i,t}^{\text{sum}} = \sum_v \pi_{\theta_{\text{old}}}(v | \cdot) = 1\)。
**代理熵公式**。我们定义代理熵作为真实熵的近似:
\[\tilde{H}_{i,t}(\theta) = -\dot{p}_{i,t} \log(\dot{p}_{i,t}) - \dot{p}_{i,t}^{\text{max}} \log(\dot{p}_{i,t}^{\text{max}}). \tag{5}\]
然后我们定义基于代理熵的调节因子:
\[\delta_{i,t}(\theta) = \tilde{H}_{i,t}(\theta) - \tilde{H}^{\text{avg}},\]
其中 \(\tilde{H}^{\text{avg}}\) 是一个参考值(例如,在训练集上计算的经验中位数)。该偏差指导调节:当 \(\delta_{i,t}(\theta) > 0\) 时,词元具有高于平均的不确定性;当 \(\delta_{i,t}(\theta) < 0\) 时,词元高度确定(过度自信)。我们确保该因子与被调节的数量成正比,从而避免在重要更新中饱和。我们使用一个软映射函数 \(f_{i,t}(x)\),定义为:
\[f_{i,t}(x) = \sigma\left( \tau_{i,t}(x-1) \right) \cdot \frac{4}{\tau_{i,t}}, \quad \text{其中} \quad \tau_{i,t} = \begin{cases} \tau_{\text{pos}}, & \hat{A}_{i,t} > 0, \\ \tau_{\text{neg}}, & \text{否则。} \end{cases} \tag{7}\]
## 4 方法
### 4.1 问题形式化:粒度不匹配
标准RLVR方法(例如GRPO)将轨迹级奖励 \(R(\mathbf{y})\) 均匀地分配给所有词元。然而,这忽略了单个推理步骤的非均匀贡献。我们假设存在一个**潜在奖励分解**:\(R(\mathbf{y}) = \sum_{t=1}^T r_t^*\),其中 \(r_t^*\) 表示词元 \(y_t\) 的不可观测贡献。为了解决这个粒度不匹配问题,我们寻求一个逐步权重 \(\alpha_t\),使得加权后的稀疏信号通过最小化均方误差(MSE)来近似潜在的密集信号:
\[\min_{\alpha_t} \mathcal{J}(\alpha_t) = \mathbb{E}_{\mathbf{y}} \left[ \left\| \alpha_t R(\mathbf{y}) - r_t^* \right\|^2 \right]. \tag{8}\]
最优解 \(\alpha_t^* = \mathbb{E}[r_t^* R(\mathbf{y})] / \mathbb{E}[R(\mathbf{y})^2]\) 表明信用应与词元的潜在重要性成正比。由于 \(r_t^*\) 不可观测,我们将预测不确定性视为一个自然代理。在推理任务中,尽管“填充词元”(例如“Therefore,”)往往表现出高置信度(低熵),但关键的逻辑转折点和错误后状态通常与逐步条件熵 \(H(\pi_\theta(\cdot | \mathbf{q}, \mathbf{y}_{<t}))\) 的峰值一致。这一观察促使我们使用不确定性代理来估计潜在贡献 \(r_t^*\)。
### 4.2 代理熵:公式和动机
计算真实熵需要在整个词表 \(\mathcal{V}\) 上进行求和,这在大型词表中计算成本高昂且对尾部分布噪声敏感。相反,我们提出一个**模态局部代理熵**,它仅依赖于两个关键量:采样词元的概率 \(p_{i,t}^*\) 和最大概率 \(p_{i,t}^{\text{max}}\)。
代理熵 \(\tilde{H}_{i,t}(\theta)\) 近似于两个选定点上的二元熵(公式5)。我们选择这种形式是因为它:
- 提供了一个局部、可解析的不确定性度量,其计算成本比全词表熵低得多;
- 对尾部分布噪声不敏感,因为它仅依赖于前两个模式;
- 保持与真实熵单调且强相关的关系(在第5.1节中经验验证)。
为了进一步稳定训练,我们对代理熵运行指数移动平均(EMA)以获得平滑参考 \(\tilde{H}^{\text{avg}}\)。这个参考用于计算偏差 \(\delta_{i,t}(\theta) = \tilde{H}_{i,t}(\theta) - \tilde{H}^{\text{avg}}\)。
### 4.3 优化不匹配:真实熵问题
使用真实熵 \(H(\pi_\theta)\) 直接进行信用分配会引入**优化不匹配**。这源于一个根本性的结构差异:策略梯度 \(\nabla_\theta \log \pi_\theta(y_{i,t} | \mathbf{q}, \mathbf{y}_{i,<t})\) 仅作用于被采样的词元 \(y_{i,t}\),而真实熵的梯度 \(\nabla_\theta H_t(\theta) = -\sum_{v \in \mathcal{V}} \nabla_\theta \pi_\theta(v | \cdot) (1 + \log \pi_\theta(v | \cdot))\) 同时更新词表 \(\mathcal{V}\) 中的所有词元——甚至包括那些从未被采样的词元。这种全分布信号引入了梯度分量,它们可能与采样词元策略更新竞争或冲突。这可能导致训练不稳定,因为优化目标鼓励整个分布的变化,而这些变化并不能直接改善被采样动作的可能性。相比之下,我们的模态局部代理熵 \(\tilde{H}_{i,t}(\theta)\) 仅通过采样词元概率 \(p_{i,t}^*\) 和最大概率 \(p_{i,t}^{\text{max}}\) 依赖于 \(\theta\),因此梯度仅在与这两个量对应的方向上传播。在经验上,对于经过良好训练的SFT模型,采样词元通常是模态或接近模态的,这意味着 \(\tilde{H}_{i,t}(\theta)\) 提供的更新信号与采样词元策略更新自然对齐。
### 4.4 ACPO目标函数
我们提出**自适应信用策略优化(ACPO)**。ACPO通过引入代理熵偏差 \(\delta_{i,t}(\theta)\) 来修正优势估计 \(\hat{A}_{i,t}\)。具体来说,我们定义ACPO调节后的优势为:
\[\hat{A}_{i,t}^{\text{ACPO}} = \begin{cases} (2 + \delta_{i,t}(\theta)) \cdot \hat{A}_i, & \text{如果 } \hat{A}_i > 0, \\ (1 - \delta_{i,t}(\theta)) \cdot \hat{A}_i, & \text{否则。} \end{cases} \tag{12}\]
#### 非对称调制。
\(\hat{A}_{i,t}^{\text{ACPO}}\) 的函数形式受两个互补原则驱动:
1. 1. **正优势轨迹**。对于具有正优势的轨迹,我们为高不确定性词元分配更大的权重,鼓励模型强化不确定但成功的推理决策。常数偏移量2作为一个保持正性的边际;在5.2节 (https://arxiv.org/html/2607.03126#S5.SS2) 分析的模态对齐和近端更新近似下,它使主阶调节因子保持正数,降低了梯度方向反转的风险。
2. 2. **非正优势轨迹**。对于轨迹相似文章
用于离散策略优化的引导对比Token信用分配
本文提出引导对比策略优化(GCPO),这是一种新颖的算法,通过对比正负提示下的模型预测,在强化学习中实现每个Token的信用分配,在文本到图像生成和思维链推理基准测试中持续优于GRPO和DAPO基线。
超越熵:通过对比策略优化的正确性感知优势塑造
本文介绍了对比策略优化(CPO),该方法利用参考引导和普通生成分布之间的token级对比差异,在具有可验证奖励的强化学习中进行正确性感知的优势塑造。CPO在域内和域外基准测试中均优于基于熵的RLVR方法。
APPO: 智能体过程策略优化
APPO通过使用细粒度决策点和过程级优势缩放来改进分支决策和信用分配,从而提升LLM智能体的多轮工具使用能力,在13个基准测试中比基线高出近4个百分点。
选择性优势熵自适应范围GRPO:用于语言模型高效强化学习的非对称令牌级折扣
本文介绍了GRPO的自适应范围和选择性优势变体,这些变体使用基于熵的令牌级折扣来稳定训练并提高数学推理任务的性能,以更低的方差实现了更强的结果。
Contrastive Branch Policy Optimization
CBPO引入了一种对比分支策略优化方法,用于具有可验证奖励的强化学习中的细粒度信用分配,提升了语言模型在多个基准测试中集成工具的推理任务的性能。