ACLArena:多阶段后训练中的智能体持续学习

Hugging Face Daily Papers 论文

摘要

本文介绍了ACLArena,这是一个用于评估多阶段后训练中智能体持续学习的框架,分析了遗忘和泛化机制,并提出了使用离线重放和LoRA专家的改进ACL方案。

构建用于工业部署的通用智能体需要整合多种能力,每种能力通常在训练的不同阶段获得。然而,目前尚无成熟的智能体持续学习(ACL)方案,对现有集成范式的权衡知之甚少。为解决这一问题,我们引入了ACLArena,一个用于全面研究、分析和评估ACL的框架。我们首先构建了一个顺序训练流程,并进行了深入分析,从模型层面和token层面这两个互补视角解释了遗忘和泛化机制。在这些分析的指导下,我们系统地比较了多教师on-policy蒸馏、自蒸馏微调和模型合并,以评估它们在恢复先前学习能力的同时保留新获得能力的能力。通过大量实验,我们详细理解了能力如何在不同阶段间转移。最后,我们提出了一种新的ACL方案,它结合了高质量轨迹的离线重放和通过RL专门化的多个LoRA专家的路由网络,显著提高了智能体跨多个领域学习的能力。在四种推理和智能体任务上进行全面实验,在领域内和领域外设置下评估,证明了我们分析的价值和方法的有效性。
查看原文
查看缓存全文

缓存时间: 2026/09/22 23:29

论文页面 - ACLArena:多阶段后训练中的智能体持续学习

来源:https://huggingface.co/papers/2609.23989 作者: , , , , , , , , , ,

摘要

为工业部署构建通用智能体需要集成多种能力,每种能力通常在训练的不同阶段习得。然而,目前对于智能体持续学习(ACL)尚无成熟的方案,现有集成范式间的权衡也鲜有研究。为弥补这一空白,我们引入了ACLArena框架,用于全面研究、分析和评估ACL。我们首先构建了一个顺序训练流水线,并从模型层面和Token层面这两个互补视角,对遗忘和泛化机制进行了深入分析。基于这些分析,我们系统比较了多教师在策略蒸馏、自蒸馏微调和模型合并,以评估它们在保持新习得能力的同时恢复先前所学能力的能力。通过大量实验,我们对能力在各阶段间的迁移建立了深入理解。最后,我们提出了一种新的ACL方案,它将基于高质量轨迹的离线重播与多个LoRA专家的路由网络相结合,每个专家通过RL进行专门化训练,显著提升了智能体跨多领域学习的能力。在四种推理和智能体任务上,于域内和域外设置下进行的综合实验,证明了我们分析的价值和方法的有效性。

查看arXiv页面 (https://arxiv.org/abs/2609.23989) 查看PDF (https://arxiv.org/pdf/2609.23989) GitHub1 (https://github.com/WillDreamer/ACLArena) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.23989)

在你的智能体中获取此论文: hf papers read 2609.23989

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型0

无模型链接此论文

在模型README.md中引用arxiv.org/abs/2609.23989以从本页链接。

引用本文的数据集0

无数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2609.23989以从本页链接。

引用本文的Spaces0

无Space链接此论文

在Space README.md中引用arxiv.org/abs/2609.23989以从本页链接。

包含本文的合集0

无合集包含此论文

将本文添加到合集 (https://huggingface.co/new-collection) 以从本页链接。

相似文章

CLAP:领域智能体后训练的闭环训练、评估与发布控制

arXiv cs.AI

CLAP提出了一种面向领域智能体后训练的闭环方法,将含噪业务数据转化为结构化的SFT和偏好样本,并结合奖励/KL诊断、离线门控以及应用链路重放来决定适配器是否发布。在五个制造批次上的实验显示平均增益适度,并强调回归和高KL风险需要集成的数据-训练-评估-发布循环,而非依赖单一评分。