PCSD:智能体强化学习中自蒸馏的持久一致性

Hugging Face Daily Papers 论文

摘要

PCSD 提出了一种利用教师偏好信号的持久一致性在智能体强化学习中提供密集 token 级监督的方法,在 ALFWorld 和 WebShop 上相较于 GRPO 和 SDAR 等基线取得了更好性能。

大型语言模型智能体在复杂交互任务中展现出强大的潜力,然而,它们的强化学习(RL)常常受到稀疏奖励的阻碍,因为一条长的多轮轨迹可能只能获得一个单一的结果级信号。同策略自蒸馏(OPSD)从特权教师模型中提供密集的 token 级监督,但教师模型并非在每个位置都可靠。现有方法通常依赖孤立的 token 级差异,这容易对噪声敏感,或者分配一个共享的步骤级权重,这可能会忽略位置变化。我们提出了持久一致性自蒸馏(PCSD),它从教师偏好信号的局部持久性中推导出 token 级蒸馏权重。PCSD 将自适应窗口与指数衰减聚合相结合,以捕获持久的相对教师支持,应用趋势感知调制来衰减局部下降的支持,并通过 sigmoid 门控生成连续权重。由此产生的目标与 GRPO 联合优化,将密集的教师指导与稀疏的环境反馈相结合。在不使用推理时技能的情况下,PCSD 在两种骨干网络上均取得了所有基线中最佳的 ALFWorld Overall 结果,超过 GRPO 15.6 和 13.3 分,超过 SDAR 6.2 和 5.5 分,同时在 WebShop 上保持竞争力,并在未见过的 ALFWorld 划分上比 GRPO 高出 15.8 分。
查看原文
查看缓存全文

缓存时间: 2026/08/05 05:43

论文页面 - PCSD:智能体强化学习中的自蒸馏持久一致性

来源:https://huggingface.co/papers/2608.01837

摘要

大语言模型智能体在复杂交互任务中展现出强大潜力,但其强化学习(RL)常常受到稀疏奖励的阻碍,因为一条长的多轮轨迹可能只收到单一的结果级信号。同策略自蒸馏(OPSD)通过特权教师提供密集的词元级监督,但教师并非在每个位置都可靠。现有方法通常依赖孤立的词元级差异,这容易对噪声敏感,或分配一个共享的步骤级权重,可能忽略位置变化。我们提出持久一致性自蒸馏(PCSD),从教师偏好信号的局部持久性中推导词元级蒸馏权重。PCSD 结合自适应窗口与指数衰减聚合来捕捉持久的相对教师支持,应用趋势感知调制来减弱局部下降的支持,并通过 sigmoid 门控产生连续权重。所得目标与 GRPO 联合优化,结合密集教师指导与稀疏环境反馈。无需推理时技能,PCSD 在两个骨干网络上均取得所有基线中最优的 ALFWorld Overall 结果,超过 GRPO 15.6 和 13.3 分,超过 SDAR 6.2 和 5.5 分,同时在 WebShop 上保持竞争力,并在未见过的 ALFWorld 数据划分上比 GRPO 提升 15.8 分。

查看 arXiv 页面 (https://arxiv.org/abs/2608.01837)查看 PDF (https://arxiv.org/pdf/2608.01837)项目页面 (https://pcsd.vercel.app/)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.01837)

在你的智能体中获取这篇论文:

hf papers read 2608\.01837

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.01837 即可从此页面链接到该模型。

引用此论文的数据集 0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.01837 即可从此页面链接到该数据集。

引用此论文的 Space 0

没有 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2608.01837 即可从此页面链接到该 Space。

包含此论文的 Collection 0

没有包含此论文的 Collection

将此论文添加到 Collection (https://huggingface.co/new-collection) 即可从此页面链接到它。

相似文章

AgentOPSD:智能体强化学习中的递归自蒸馏

Hugging Face Daily Papers

AgentOPSD 提出了一种无评论家的递归方法,用于智能体强化学习中的回合级信用分配,通过在 log-odds 空间中进行贝叶斯信念更新来重新加权结果。它在 ALFWorld 上使用 Qwen2.5-7B 达到了 89.1% 的成功率,优于 GRPO 和自蒸馏基线。

Self-Distilled Agentic Reinforcement Learning

Hugging Face Daily Papers

SDAR通过将自蒸馏与Sigmoid门控相结合,有选择地增强正向令牌级引导,同时减轻负面教师拒绝的影响,从而增强多轮智能体训练,在多个基准测试中相较于GRPO取得了显著提升。

自蒸馏策略梯度

arXiv cs.LG

SDPG(自蒸馏策略梯度)是一种面向大语言模型的全新强化学习训练框架,结合了基于组相对验证器的优势函数、在线自蒸馏与KL正则化,旨在解决RLVR训练中稀疏奖励与训练不稳定的问题。该方法通过条件化特权上下文,使同一模型同时充当学生和教师,在稳定性和性能上均优于RLVR及自蒸馏基线方法。

Self-CTRL:基于强化学习的自一致性训练

arXiv cs.LG

Self-CTRL 是一种强化学习方法,旨在提高语言模型自我解释与实际行为之间的一致性。它显著提升了自我报告偏差与测量偏差之间的相关性,并将拒绝预测准确率从36%提升到92%,同时减少了有害响应率。