SEED: 面向智能体强化学习的自进化在线策略蒸馏
摘要
提出 SEED,一种自进化在线策略蒸馏框架,将已完成的轨迹转化为后见技能,以改进交互式智能体任务的强化学习,取得了持续的性能提升和样本效率。
查看缓存全文
缓存时间: 2026/07/20 09:38
论文页面 - SEED: 自我演化的在线策略蒸馏用于智能体强化学习
来源:https://huggingface.co/papers/2607.14777
摘要
大型语言模型越来越多地被训练成交互式智能体,以完成涉及多轮交互、工具使用和环境反馈的长周期任务。基于结果的强化学习(RL)提供了一种实用的优化范式,但其稀疏的轨迹级奖励对中间决策的指导有限,导致在回合级结果与词元级策略学习之间存在监督差距。我们提出SEED(自我演化的在线策略蒸馏),一个自我演化框架,它将完整的在线策略轨迹转化为训练时的后见技能,并将这些技能的行为效应蒸馏回策略模型中。SEED首先微调策略,使其能够分析完整轨迹并生成自然语言技能,这些技能捕获可复用的工作流、关键观察或失败规避规则。在RL过程中,当前策略既收集轨迹,又充当从轨迹中提取后见技能的分析器。因此,策略更新将同时改进后续决策和技能分析,使得后见监督能够随策略一同演化。随后,SEED在普通上下文和技能增强上下文下对采样动作重新打分,将技能引起的概率偏移转化为密集的词元级在线策略蒸馏信号。该信号与基于结果的RL联合优化,确保辅助监督与当前轨迹分布保持一致。在基于文本和基于视觉的智能体任务上的大量实验表明,SEED能够持续提升性能和样本效率,并展现出对未见场景的鲁棒泛化能力。我们的代码可在 https://github.com/jinyangwu/SEED 获取。
查看arXiv页面 (https://arxiv.org/abs/2607.14777) 查看PDF (https://arxiv.org/pdf/2607.14777) 项目页面 (https://jinyangwu.github.io/seed/) GitHub124 (https://github.com/jinyangwu/SEED) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.14777)
在您的智能体中获取此论文:
hf papers read 2607.14777
没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型1
Jinyang23/Seed-AlfWorld-3B 文本生成 • 3B • 3天前更新 • 426 • 2 (https://huggingface.co/Jinyang23/Seed-AlfWorld-3B)
引用此论文的数据集0
没有链接此论文的数据集
在数据集的README.md中引用 arxiv.org/abs/2607.14777 即可从本页链接到它。
引用此论文的Space0
没有链接此论文的Space
在Space的README.md中引用 arxiv.org/abs/2607.14777 即可从本页链接到它。
包含此论文的收藏集9
浏览9个包含此论文的收藏集 (https://huggingface.co/collections?paper=2607.14777)
相似文章
OPID: 同策略技能蒸馏用于智能体强化学习
OPID提出了一种同策略技能蒸馏框架,从完成的轨迹中提取密集后见监督,将基于结果的强化学习与词元级自蒸馏相结合,以提高语言智能体在多轮任务上的训练效率和性能。
OPID:面向智能体强化学习的在线策略技能蒸馏
OPID 是一个框架,它从完成的在线策略轨迹中提取密集的词元级监督信号,用于语言智能体的强化学习,通过分层技能(情节级和步骤级)来提高样本效率和鲁棒性。
OPD-Evolver:通过在线策略蒸馏培育整体智能体进化器
OPD-Evolver 提出了一种自我进化智能体框架,采用慢-快协同进化与在线策略自蒸馏,以增强记忆管理和策略学习,在多个领域基准测试中优于 ReasoningBank 和 Skill0 等现有方法。
SEAD: 通过熵引导监督的胜任力感知在线策略蒸馏
SEAD 提出了一种胜任力感知的在线策略蒸馏方法,利用熵在词元、训练阶段和提示三个层面引导监督,在 OLMo-3 上对六个数学基准测试实现了平均准确率提升 +4.8%。
自蒸馏策略梯度
本文提出SDPG,一种自蒸馏策略梯度框架,结合在线策略自蒸馏、验证器优势及KL正则化,以提升强化学习的稳定性和性能。