SEED: 面向智能体强化学习的自进化在线策略蒸馏

Papers with Code Trending 论文

摘要

提出 SEED,一种自进化在线策略蒸馏框架,将已完成的轨迹转化为后见技能,以改进交互式智能体任务的强化学习,取得了持续的性能提升和样本效率。

大语言模型正越来越多地被训练成交互式智能体,用于涉及多轮交互、工具使用和环境反馈的长时任务。基于结果的强化学习(RL)提供了一种实用的优化范式,但其稀疏的轨迹级奖励对中间决策的指导有限,在回合级结果和词元级策略学习之间留下了监督缺口。我们提出了 SEED(自进化在线策略蒸馏),这是一个自进化框架,它将完成的在线策略轨迹转化为训练时的后见技能,并将其行为效果蒸馏回策略模型。SEED 首先微调策略以分析已完成的轨迹,并生成捕获可重用工作流、关键观察或避免失败规则的自然语言技能。在强化学习过程中,当前策略既收集轨迹,又充当从其提取后见技能的分析器。因此,策略更新共同改进了后续的决策制定和技能分析,使后见监督随策略一起进化。然后,SEED 在普通和技能增强的背景下对采样动作重新评分,将技能引起的概率变化转化为密集的词元级在线策略蒸馏信号。该信号与基于结果的强化学习联合优化,保持辅助监督与当前轨迹分布对齐。在基于文本和基于视觉的智能体任务上进行的广泛实验表明,SEED 持续提升了性能和样本效率,展现出对未见场景的稳健泛化。我们的代码可在 https://github.com/jinyangwu/SEED 获取。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:38

论文页面 - SEED: 自我演化的在线策略蒸馏用于智能体强化学习

来源:https://huggingface.co/papers/2607.14777

摘要

大型语言模型越来越多地被训练成交互式智能体,以完成涉及多轮交互、工具使用和环境反馈的长周期任务。基于结果的强化学习(RL)提供了一种实用的优化范式,但其稀疏的轨迹级奖励对中间决策的指导有限,导致在回合级结果与词元级策略学习之间存在监督差距。我们提出SEED(自我演化的在线策略蒸馏),一个自我演化框架,它将完整的在线策略轨迹转化为训练时的后见技能,并将这些技能的行为效应蒸馏回策略模型中。SEED首先微调策略,使其能够分析完整轨迹并生成自然语言技能,这些技能捕获可复用的工作流、关键观察或失败规避规则。在RL过程中,当前策略既收集轨迹,又充当从轨迹中提取后见技能的分析器。因此,策略更新将同时改进后续决策和技能分析,使得后见监督能够随策略一同演化。随后,SEED在普通上下文和技能增强上下文下对采样动作重新打分,将技能引起的概率偏移转化为密集的词元级在线策略蒸馏信号。该信号与基于结果的RL联合优化,确保辅助监督与当前轨迹分布保持一致。在基于文本和基于视觉的智能体任务上的大量实验表明,SEED能够持续提升性能和样本效率,并展现出对未见场景的鲁棒泛化能力。我们的代码可在 https://github.com/jinyangwu/SEED 获取。

查看arXiv页面 (https://arxiv.org/abs/2607.14777) 查看PDF (https://arxiv.org/pdf/2607.14777) 项目页面 (https://jinyangwu.github.io/seed/) GitHub124 (https://github.com/jinyangwu/SEED) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.14777)

在您的智能体中获取此论文:

hf papers read 2607.14777

没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型1

Jinyang23/Seed-AlfWorld-3B 文本生成 • 3B • 3天前更新 • 426 • 2 (https://huggingface.co/Jinyang23/Seed-AlfWorld-3B)

引用此论文的数据集0

没有链接此论文的数据集

在数据集的README.md中引用 arxiv.org/abs/2607.14777 即可从本页链接到它。

引用此论文的Space0

没有链接此论文的Space

在Space的README.md中引用 arxiv.org/abs/2607.14777 即可从本页链接到它。

包含此论文的收藏集9

浏览9个包含此论文的收藏集 (https://huggingface.co/collections?paper=2607.14777)

相似文章

OPID: 同策略技能蒸馏用于智能体强化学习

Hugging Face Daily Papers

OPID提出了一种同策略技能蒸馏框架,从完成的轨迹中提取密集后见监督,将基于结果的强化学习与词元级自蒸馏相结合,以提高语言智能体在多轮任务上的训练效率和性能。

自蒸馏策略梯度

Hugging Face Daily Papers

本文提出SDPG,一种自蒸馏策略梯度框架,结合在线策略自蒸馏、验证器优势及KL正则化,以提升强化学习的稳定性和性能。