OPD-Evolver:通过在线策略蒸馏培育整体智能体进化器

Hugging Face Daily Papers 论文

摘要

OPD-Evolver 提出了一种自我进化智能体框架,采用慢-快协同进化与在线策略自蒸馏,以增强记忆管理和策略学习,在多个领域基准测试中优于 ReasoningBank 和 Skill0 等现有方法。

内存已成为自我进化智能体的标准基础,然而保留经验并不等同于学习如何通过经验进化。现有的记忆智能体可以存储轨迹、检索反思或积累技能,但往往缺乏整体能力来选择有用经验、据此行动、编写可重用知识并维护不断增长的仓库。我们提出了 OPD-Evolver,一种慢-快协同进化框架,通过在线策略自蒸馏来培养这样的智能体进化器。在快速循环中,OPD-Evolver 与四级记忆层次结构交互,以读取、使用、编写和维护经验,实现快速的测试时进化。在慢速循环中,结果校准的记忆归因与特权事后总结将这些能力蒸馏到可部署的策略中。在多个领域基准测试中,OPD-Evolver 超越了如 ReasoningBank 等记忆系统,性能提升高达 11.5%,以及基于训练的方法如 Skill0,提升约 5.8%。进一步分析表明,OPD-Evolver 将高价值经验和内存管理内化,使 OPD-Evolver-9B 能够挑战如 Qwen3.5-397B-A17B 和 Step-3.5-Flash 等巨量模型,这标志着超越记忆增强型智能体,迈向真正合格的智能体进化器。
查看原文
查看缓存全文

缓存时间: 2026/06/17 03:35

论文页面 - OPD-Evolver: 通过在线策略蒸馏培养整体性智能体进化器

来源:https://huggingface.co/papers/2606.17628

摘要

OPD-Evolver 是一个自我进化的智能体框架,它将慢快协同进化与在线策略自蒸馏相结合,以增强跨多个领域的记忆管理与策略学习。

记忆已成为自进化智能体的标准基础,但保留经验并不等同于学习如何通过经验进化。现有的记忆智能体可以存储轨迹、检索反思或积累技能,但通常缺乏选择有用经验、据此采取行动、编写可复用知识并维护不断增长存储库的整体能力。我们引入了 OPD-Evolver,一种通过 在线策略自蒸馏 培养此类 智能体进化器慢快协同进化 框架。在快循环中,OPD-Evolver 与一个四级 记忆层次 进行交互,以读取、使用、编写和维护经验,实现快速的测试时进化。在慢循环中,结果校准的记忆归因与特权事后洞察将这些四种能力蒸馏到可部署的策略中。跨多领域基准测试中,OPD-Evolver 在记忆系统(如 ReasoningBank)上最高提升 11.5%,在基于训练的方法(如 Skill0)上提升约 5.8%。进一步分析表明,OPD-Evolver 内化了高价值经验与 记忆管理,使得 OPD-Evolver-9B 能够挑战如 Qwen3.5-397B-A17B 和 Step-3.5-Flash 等庞然大物,指向真正合格的 智能体进化器,而非仅凭记忆增强的智能体。

查看 arXiv 页面 (https://arxiv.org/abs/2606.17628) | 查看 PDF (https://arxiv.org/pdf/2606.17628) | GitHub0 (https://github.com/bingreeky/opd-evolver) | 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.17628)

引用此论文的模型1

greeky/OPDEvolver 更新于约1小时前 (https://huggingface.co/greeky/OPDEvolver)

引用此论文的数据集0

暂无关联此论文的数据集

请在数据集 README.md 中引用 arxiv.org/abs/2606.17628 以从本页面链接。

引用此论文的 Spaces0

暂无关联此论文的 Space

请在 Space README.md 中引用 arxiv.org/abs/2606.17628 以从本页面链接。

包含此论文的收藏0

暂无包含此论文的收藏

请将此论文添加至一个收藏以从本页面链接。

相似文章

OPID: 同策略技能蒸馏用于智能体强化学习

Hugging Face Daily Papers

OPID提出了一种同策略技能蒸馏框架,从完成的轨迹中提取密集后见监督,将基于结果的强化学习与词元级自蒸馏相结合,以提高语言智能体在多轮任务上的训练效率和性能。

Flux-OPD:演化上下文下的同策略蒸馏

Hugging Face Daily Papers

Flux-OPD 提出了一种同策略蒸馏范式,利用演化上下文作为训练中的监督信号,以捕获开放领域中的任务偏好,优于现有的 OPD 范式。

β-OPSD:以策略优化推导,以自蒸馏训练

Hugging Face Daily Papers

本文介绍了β-OPSD,它是同策略自蒸馏(OPSD)的一种泛化形式,将其构建为一个具有可控KL惩罚的策略优化家族。该方法利用蒸馏来近似昂贵的策略优化,在数学基准上提升了稳定性和推理性能。