ACLArena:多阶段后训练中的智能体持续学习
摘要
本文介绍了ACLArena,这是一个用于评估多阶段后训练中智能体持续学习的框架,分析了遗忘和泛化机制,并提出了使用离线重放和LoRA专家的改进ACL方案。
查看缓存全文
缓存时间: 2026/09/22 23:29
论文页面 - ACLArena:多阶段后训练中的智能体持续学习
来源:https://huggingface.co/papers/2609.23989 作者: , , , , , , , , , ,
摘要
为工业部署构建通用智能体需要集成多种能力,每种能力通常在训练的不同阶段习得。然而,目前对于智能体持续学习(ACL)尚无成熟的方案,现有集成范式间的权衡也鲜有研究。为弥补这一空白,我们引入了ACLArena框架,用于全面研究、分析和评估ACL。我们首先构建了一个顺序训练流水线,并从模型层面和Token层面这两个互补视角,对遗忘和泛化机制进行了深入分析。基于这些分析,我们系统比较了多教师在策略蒸馏、自蒸馏微调和模型合并,以评估它们在保持新习得能力的同时恢复先前所学能力的能力。通过大量实验,我们对能力在各阶段间的迁移建立了深入理解。最后,我们提出了一种新的ACL方案,它将基于高质量轨迹的离线重播与多个LoRA专家的路由网络相结合,每个专家通过RL进行专门化训练,显著提升了智能体跨多领域学习的能力。在四种推理和智能体任务上,于域内和域外设置下进行的综合实验,证明了我们分析的价值和方法的有效性。
查看arXiv页面 (https://arxiv.org/abs/2609.23989) 查看PDF (https://arxiv.org/pdf/2609.23989) GitHub1 (https://github.com/WillDreamer/ACLArena) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.23989)
在你的智能体中获取此论文:
hf papers read 2609.23989
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型0
无模型链接此论文
在模型README.md中引用arxiv.org/abs/2609.23989以从本页链接。
引用本文的数据集0
无数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2609.23989以从本页链接。
引用本文的Spaces0
无Space链接此论文
在Space README.md中引用arxiv.org/abs/2609.23989以从本页链接。
包含本文的合集0
无合集包含此论文
将本文添加到合集 (https://huggingface.co/new-collection) 以从本页链接。
相似文章
CLaaS:面向样本高效在线学习的持续学习即服务
CLaaS是一个系统,用于对部署中的LLM智能体进行持续学习,利用经验回放实现样本高效的在线适应。
CLAP:领域智能体后训练的闭环训练、评估与发布控制
CLAP提出了一种面向领域智能体后训练的闭环方法,将含噪业务数据转化为结构化的SFT和偏好样本,并结合奖励/KL诊断、离线门控以及应用链路重放来决定适配器是否发布。在五个制造批次上的实验显示平均增益适度,并强调回归和高KL风险需要集成的数据-训练-评估-发布循环,而非依赖单一评分。
AgentCL: 面向语言代理中持续学习的严谨评估
提出了一个全面的评估框架,用于语言代理中的持续学习,强调受控任务流和记忆设计分析,以更好地评估可复用经验和学习稳定性。
Macaron-V1:迈向具有自我改进与Mixture-of-LoRA的开放持续学习
本文介绍了Macaron-V1,一个开放的持续学习智能体-模型家族,使用Mixture-of-LoRA在冻结的基础模型上组合专家适配器,并具有递归自我改进和模型-框架协同设计。
从受训者到训练者:面向多智能体推理的强化学习的LLM设计训练环境
本文提出了LLM-as-Environment-Engineer框架,其中策略模型通过分析失败案例自动重新设计强化学习训练环境,并引入MAPF-FrozenLake作为可控测试平台。该框架使用Qwen3-4B模型,性能优于GPT和Gemini等更大规模模型,表明策略学习提升了模型诊断自身弱点的能力。