OPD-Evolver:通过在线策略蒸馏培育整体智能体进化器
摘要
OPD-Evolver 提出了一种自我进化智能体框架,采用慢-快协同进化与在线策略自蒸馏,以增强记忆管理和策略学习,在多个领域基准测试中优于 ReasoningBank 和 Skill0 等现有方法。
查看缓存全文
缓存时间: 2026/06/17 03:35
论文页面 - OPD-Evolver: 通过在线策略蒸馏培养整体性智能体进化器
来源:https://huggingface.co/papers/2606.17628
摘要
OPD-Evolver 是一个自我进化的智能体框架,它将慢快协同进化与在线策略自蒸馏相结合,以增强跨多个领域的记忆管理与策略学习。
记忆已成为自进化智能体的标准基础,但保留经验并不等同于学习如何通过经验进化。现有的记忆智能体可以存储轨迹、检索反思或积累技能,但通常缺乏选择有用经验、据此采取行动、编写可复用知识并维护不断增长存储库的整体能力。我们引入了 OPD-Evolver,一种通过 在线策略自蒸馏 培养此类 智能体进化器 的 慢快协同进化 框架。在快循环中,OPD-Evolver 与一个四级 记忆层次 进行交互,以读取、使用、编写和维护经验,实现快速的测试时进化。在慢循环中,结果校准的记忆归因与特权事后洞察将这些四种能力蒸馏到可部署的策略中。跨多领域基准测试中,OPD-Evolver 在记忆系统(如 ReasoningBank)上最高提升 11.5%,在基于训练的方法(如 Skill0)上提升约 5.8%。进一步分析表明,OPD-Evolver 内化了高价值经验与 记忆管理,使得 OPD-Evolver-9B 能够挑战如 Qwen3.5-397B-A17B 和 Step-3.5-Flash 等庞然大物,指向真正合格的 智能体进化器,而非仅凭记忆增强的智能体。
查看 arXiv 页面 (https://arxiv.org/abs/2606.17628) | 查看 PDF (https://arxiv.org/pdf/2606.17628) | GitHub0 (https://github.com/bingreeky/opd-evolver) | 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.17628)
引用此论文的模型1
greeky/OPDEvolver 更新于约1小时前 (https://huggingface.co/greeky/OPDEvolver)
引用此论文的数据集0
暂无关联此论文的数据集
请在数据集 README.md 中引用 arxiv.org/abs/2606.17628 以从本页面链接。
引用此论文的 Spaces0
暂无关联此论文的 Space
请在 Space README.md 中引用 arxiv.org/abs/2606.17628 以从本页面链接。
包含此论文的收藏0
暂无包含此论文的收藏
请将此论文添加至一个收藏以从本页面链接。
相似文章
OPID: 同策略技能蒸馏用于智能体强化学习
OPID提出了一种同策略技能蒸馏框架,从完成的轨迹中提取密集后见监督,将基于结果的强化学习与词元级自蒸馏相结合,以提高语言智能体在多轮任务上的训练效率和性能。
Flux-OPD:演化上下文下的同策略蒸馏
Flux-OPD 提出了一种同策略蒸馏范式,利用演化上下文作为训练中的监督信号,以捕获开放领域中的任务偏好,优于现有的 OPD 范式。
TurnOPD: 使在线策略蒸馏对回合感知以实现高效长程智能体训练
TurnOPD 引入了回合级别的预算机制用于长程智能体的在线策略蒸馏,通过自适应 rollout 深度和渐进式回合归一化损失预算解决了传统 OPD 的低效问题,在相同训练预算下实现了更高的准确性。
SEED: 面向智能体强化学习的自进化在线策略蒸馏
提出 SEED,一种自进化在线策略蒸馏框架,将已完成的轨迹转化为后见技能,以改进交互式智能体任务的强化学习,取得了持续的性能提升和样本效率。
β-OPSD:以策略优化推导,以自蒸馏训练
本文介绍了β-OPSD,它是同策略自蒸馏(OPSD)的一种泛化形式,将其构建为一个具有可控KL惩罚的策略优化家族。该方法利用蒸馏来近似昂贵的策略优化,在数学基准上提升了稳定性和推理性能。