AgentOPSD:智能体强化学习中的递归自蒸馏
摘要
AgentOPSD 提出了一种无评论家的递归方法,用于智能体强化学习中的回合级信用分配,通过在 log-odds 空间中进行贝叶斯信念更新来重新加权结果。它在 ALFWorld 上使用 Qwen2.5-7B 达到了 89.1% 的成功率,优于 GRPO 和自蒸馏基线。
查看缓存全文
缓存时间: 2026/08/07 05:55
论文页面 - AgentOPSD:面向智能体强化学习的递归自蒸馏
来源: https://huggingface.co/papers/2608.05987 发布于 8月6日
#1 当日论文 (https://huggingface.co/papers/date/2026-08-07)
作者:
,
,
,
,
,
,
,
,
,
,
,
摘要
带可验证奖励的强化学习(RL)构建了轨迹级别的优势估计,但在长周期、多轮智能体任务中,往往难以准确归因于少数决定最终结果的关键决策。近期工作引入了特权自蒸馏(privileged self-distillation)进行信用分配,提供密集监督,但仍不清楚此类局部信号应如何表示序列信用。我们提出 AgentOPSD,一种无评论家(critic-free)、递归的方法,用于智能体强化学习中的回合级信用分配。AgentOPSD 将词元级别的教师-学生对数概率差聚合为回合级证据,并在对数几率空间中递归更新贝叶斯信念状态。这产生了一种有原则的重新加权方案,将稀疏的结果监督转化为回合级信用信号,并通过对连续状态之间的边际信念修正来识别关键回合。该方法与标准策略优化完全兼容,既不需要额外的评论家,也不需要额外的采样。我们使用 Qwen2.5 模型在两种规模(3B 和 7B)上评估了 AgentOPSD 在 ALFWorld、WebShop 和 Search-QA 上的表现。AgentOPSD 优于 GRPO 和强自蒸馏基线,在 Qwen2.5-7B 上于 ALFWorld 达到 89.1% 的成功率。消融研究将性能提升归因于回合级聚合和依赖历史的递归信念更新。
查看 arXiv 页面 (https://arxiv.org/abs/2608.05987)查看 PDF (https://arxiv.org/pdf/2608.05987)GitHub2 (https://github.com/ZethWang/AgentOPSD)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.05987)
在您的智能体中获取此论文:
hf papers read 2608\.05987
还没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
暂无模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2608.05987,即可从本页链接到该模型。
引用此论文的数据集 0
暂无数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2608.05987,即可从本页链接到该数据集。
引用此论文的 Spaces 0
暂无 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2608.05987,即可从本页链接到该 Space。
包含此论文的收藏 0
暂无收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 即可从本页链接到该论文。
相似文章
OPID: 同策略技能蒸馏用于智能体强化学习
OPID提出了一种同策略技能蒸馏框架,从完成的轨迹中提取密集后见监督,将基于结果的强化学习与词元级自蒸馏相结合,以提高语言智能体在多轮任务上的训练效率和性能。
PCSD:智能体强化学习中自蒸馏的持久一致性
PCSD 提出了一种利用教师偏好信号的持久一致性在智能体强化学习中提供密集 token 级监督的方法,在 ALFWorld 和 WebShop 上相较于 GRPO 和 SDAR 等基线取得了更好性能。
Self-Distilled Agentic Reinforcement Learning
SDAR通过将自蒸馏与Sigmoid门控相结合,有选择地增强正向令牌级引导,同时减轻负面教师拒绝的影响,从而增强多轮智能体训练,在多个基准测试中相较于GRPO取得了显著提升。
面向进度与可靠性的智能体强化学习组策略优化
ProGPO是一种免学习评论器的方法,用于LLM智能体基于组的RL中的步骤级优势估计,它使用精确前缀动作比较和基于rollout的状态势,以改善长视界任务上的信用分配。在ALFWorld和WebShop上使用Qwen2.5模型的实验表明,它优于现有的智能体RL基线。
PBSD:用于长时域信用分配的特权贝叶斯自蒸馏
PBSD提出了一种贝叶斯自蒸馏方法,将稀疏的最终奖励转化为经过校准的回合级信用信号,用于长时域智能体任务,从而改进策略学习与泛化能力。