@omarsar0:微软的这项新工作非常有趣。(收藏起来)这项工作与利用工具进行模型后训练的新兴主题相关…

X AI KOLs Timeline 论文

摘要

Agent Lightning v1.0 是微软推出的一个轻量级框架,它将代理工具与强化学习训练相结合,利用适度计算资源提高了 Qwen3.5-9B 在 SWE-bench Verified 上的性能。

微软的这项新工作非常有趣。 (收藏起来) 这项工作与利用工具进行模型后训练的新兴主题相关。 现代代理运行在一个拥有工具、上下文和控制流的工具中。当你训练它们时,工具拥有环境循环,而训练器只看到LLM的请求和响应对。 工作原理。 Agent Lightning v1.0 通过一个端点代理将任何工具与RL连接起来,代码量约为3500行,然后处理该设置中的问题,如重分词、样本合并、优势计算、损失归一化和后端调度。 使用6K训练样本和适度计算资源,它将Qwen3.5-9B在SWE-bench Verified上的性能从41.8%提升到56.4%。 论文:https://arxiv.org/abs/2608.17528 在我们的学院中追踪更多热门AI论文:https://academy.dair.ai
查看原文
查看缓存全文

缓存时间: 2026/08/20 23:01

微软的有趣新工作。(收藏)这项工作与利用套件进行模型后训练的新兴趋势相关。现代智能体在拥有工具、上下文和控制流的套件内运行。训练它们时,套件负责环境循环,而训练器只看到大语言模型的请求和响应对。

工作原理 Agent Lightning v1.0 通过一个端点代理将任意套件与强化学习连接起来,代码量约3500行,然后分析了该设置中出现的问题:重新分词、样本合并、优势函数计算、损失归一化和后端调度。仅使用6K个训练样本和适中的算力,就将 Qwen3.5-9B 在 SWE-bench Verified 上的性能从 41.8% 提升至 56.4%。

论文链接:https://arxiv.org/abs/2608.17528
在我们的学院追踪更多热门AI论文:https://academy.dair.ai


Agent Lightning v1.0 总体框架

来源:https://arxiv.org/html/2608.17528
2026年8月

Agent Lightning v1.0:迈向套件化智能体强化学习

Zhiyuan He1,,‡, Siwei Zhang2,, Zhiwen Zhou3,*, Yuqing Yang1,‡, Yu Kang1, Yuge Zhang1, Luna K. Qiu1, Tin Yan Tsui4, Jiahang Xu1, Chong Luo1
1微软 2复旦大学 3浙江大学 4爱丁堡大学

未命名图片
图1: Agent Lightning v1.0 的总体框架。

摘要

现代智能体并非作为独立的大语言模型运行。它们运行在管理工具、上下文和控制流的智能体套件内部,这使得套件成为关键组件。我们最初的 Agent Lightning 工作引入了一种解耦架构,通过大语言模型端点代理将任意智能体与强化学习训练连接起来。近期框架如 verl Uni-Agent、AReaL 2.0、slime v0.3.0 和 Polar 也采用了这种基于代理的方法。这种基于代理的训练方法使得利用套件进行强化学习成为可能。在这项工作中,我们使用套件化智能体强化学习一词来描述这种范式,其中部署时的套件直接参与模型后训练,从而缩小训练与实际使用之间的差距。

我们发现,套件化智能体强化学习与传统的智能体强化学习有根本性区别,并引入了一系列新的挑战。在传统的智能体强化学习中,训练引擎拥有环境交互循环。而在套件化智能体强化学习中,套件拥有这个循环,而训练引擎仅观察一系列大语言模型的请求-响应对。如何将这些调用建模并组装成训练样本仍然是一个开放性问题。

通过仔细研究,我们识别出套件化智能体强化学习的几个挑战,包括重新分词、样本合并、优势函数计算、损失归一化和训练后端调度。我们发现,如果这些挑战未被妥善解决,可能导致无效或不稳定的训练。现有框架通常对这些问题的规定不够明确。

在本文中,我们首次全面阐述了这些挑战。我们进一步提出了 Agent Lightning v1.0,一个用于套件化智能体强化学习的轻量级框架。我们将简洁性作为首要原则,仅用约3500行代码实现了该框架。其紧凑设计支持任意智能体套件,并为研究这些挑战提供了实用的测试平台。

我们在通用指令跟随智能体、搜索智能体和编码智能体上验证了 Agent Lightning v1.0。对于编码智能体,我们发现现有强化学习框架提供的支持有限,包括缺乏数据和完整的训练脚本,以及依赖大规模计算资源。为弥补这一空白,我们基于开源数据集和模型,提供了完整的数据清洗流程和可复现的训练脚本。仅使用6K个训练样本和适中的计算资源,强化学习将 Qwen3.5-9B 在 SWE-bench Verified 上的性能从 41.8% 提升至 56.4%,绝对增益为14.6%。我们发布了完整的工作流程和脚本,以促进在 Agent Lightning v1.0 中实现可复现的套件化智能体强化学习。

引言

现代智能体并非作为独立的大语言模型运行。它们运行在管理工具、执行环境、上下文和控制流的智能体套件内部。因此,套件决定了智能体如何观察其环境、在长时间跨度上行动以及从故障中恢复,使其成为智能体能力的核心部分。著名案例包括编码智能体套件,如 mini-SWE-agent [25]、OpenHands [19]、OpenCode [18]、Claude Code [2] 和 Codex [16],以及通用套件,如 OpenClaw [17] 和 Hermes [15]。

早期的强化学习框架,包括 verl [24]、AReaL [6] 和 slime [34],通常要求用户在训练框架内直接实现智能体循环。因此,集成现有的智能体套件很困难,因为它们通常有复杂的实现和自身的依赖关系,难以直接集成到强化学习框架中。

我们最初的 Agent Lightning 工作 [14] 引入了一种训练与智能体执行的解耦架构。它通过一个大语言模型端点将任意智能体与强化学习训练连接起来,几乎不需要修改智能体。最近,这种基于代理的方法在 verl Uni-Agent [5]、AReaL 2.0 [28]、slime v0.3.0 [34] 和 Polar [27] 等框架中变得更加普遍,这自然实现了利用智能体套件进行强化学习训练。

我们使用套件化智能体强化学习一词来指代通过与部署时相同的智能体套件进行的强化学习训练。套件,而非训练器,负责上下文构建、工具执行和智能体-环境交互循环,而训练系统跨服务边界观察并优化由此产生的模型调用。这种表述保留了套件在部署时的上下文策略、工具协议和执行语义,而无需在强化学习框架内重新实现其智能体循环。

传统的智能体强化学习和套件化智能体强化学习都可以建模为部分可观察马尔可夫决策过程,但它们在潜在状态和呈现给策略模型的观察方面有所不同。在传统的智能体强化学习中,潜在状态主要是环境状态。策略模型几乎直接与环境通过透明层交互。模型产生动作词元,环境返回观察,词元化的观察扩展现有历史为 p_t = (p_{t-1}, a_{t-1}, o_t)。这里,p_t 是在步骤 t 呈现给模型的词元历史,a_{t-1} 是在上一步生成的动作,o_t 是最新的环境观察。因此,策略观察一个持续扩展的词元历史,一次展开自然形成一个线性的词元轨迹。

在套件化智能体强化学习中,策略模型不再直接与环境交互。潜在状态包含套件状态和环境状态。套件负责上下文构建、控制流、工具执行和智能体协调,并为每次模型调用独立构建请求提示。策略仅观察通过大语言模型API传递的确切提示,并基于该提示生成响应。因此,一次展开在模型边界呈现为一个请求-响应对序列 (p_1, a_1), (p_2, a_2), \ldots,其中 p_i 是第 i 次大语言模型调用中发送的提示,a_i 是相应的模型响应。其间的套件和环境状态转换保持为潜在状态。

图2总结了这一差异。它也引出了下面的实现挑战,现有框架对此做出了不同的选择,可能影响算法的正确性和训练的稳定性。

特性智能体强化学习套件化智能体强化学习
状态环境套件 + 环境
模型输入连续词元历史按调用提示
智能体单一ReAct智能体多智能体、子智能体和交接

图2: 传统智能体强化学习和套件化智能体强化学习的比较。两者都符合POMDP公式,但套件化智能体强化学习在潜在执行状态中增加了套件状态,并将策略模型暴露于分别构建的模型调用提示。此变化还将控制和协调转移到套件中,并使训练样本的数量更加动态。

第一个挑战是重新分词和样本合并。 智能体套件通常通过文本消息与模型API通信,而强化学习训练基于词元操作。大多数框架在 p_{i+1} 在词元级别包含 (p_i, a_i) 作为完整前缀时,会合并两次连续的调用。然而,重新分词后,即使文本不变,a_ip_{i+1} 中的词元ID也可能与模型最初采样的不同。这破坏了词元级别的连续性,阻止了两次调用被安全地合并。

第二个挑战是优势函数计算。 在传统的智能体强化学习中,每个展开序列对应一个马尔可夫过程,映射到一个唯一的训练样本。在套件化智能体强化学习中,一次展开可能产生动态数量的训练样本。这不仅源于上述的重新分词问题,还源于套件操作,如生成子智能体和总结上下文。这些动态样本挑战了如何将奖励和优势分配给训练样本。

第三个挑战是损失归一化。 在套件化智能体强化学习中,一次展开可能映射到多个训练样本,使得每个训练批次中的样本数量动态变化。因此,损失归一化变得不那么简单。例如,一些现有框架仍然在样本级别归一化损失,给予产生更多样本的展开更大的优化权重,这可能导致训练不稳定。

第四个挑战是在动态样本数量下进行训练后端调度。 一次展开批次产生的样本数量只有在套件执行和样本构建之后才知道,而训练GPU的数量及其并行配置是固定的。后端必须将这个可变的样本集划分为训练步骤和小批次,同时在固定的GPU工作节点间平衡工作负载。

在这项工作中,我们首次系统地描述了这些挑战,并进一步提出了 Agent Lightning v1.0,这是对原始 Agent Lightning 的完全重构。它是一个用于与任意智能体套件进行强化学习训练的轻量级框架。我们的设计原则是保持系统尽可能简单,用约3500行代码实现。其训练流程也嵌入了我们针对上述挑战的设计选择,为研究这些问题提供了实用的测试平台。

我们使用 Agent Lightning v1.0 训练了通用指令跟随智能体、搜索智能体和编码智能体。特别是,现有智能体框架对编码智能体的支持有限,包括缺乏数据和完整的训练脚本,这可能是由于数据清洗的复杂性、环境设置的难度以及所需大量计算资源造成的。为弥补这一空白,我们基于开源的 SWE-smith 数据集和 Qwen3.5-9B [22],提供了完整的数据清洗流程和可复现的训练脚本。

我们最终的强化学习运行仅使用6K个训练样本和适中的计算资源。仅使用强化学习,我们训练的模型在 SWE-bench Verified 上的性能从 41.8% 提升至 56.4%,绝对增益为14.6%。我们向社区发布了完整的工作流程和脚本以促进可复现性。

挑战

套件化智能体强化学习改变了训练引擎观察和建模展开序列的方式。在传统的智能体强化学习中,训练引擎拥有环境交互循环并维护完整的词元历史。这里,p_t 表示步骤 t 的提示词元,a_t 表示与响应词元对应的动作,o_t 是词元化的环境观察。下一个提示被构建为 p_t = (p_{t-1}, a_{t-1}, o_t)。整个展开序列遵循 (p_1, a_1, o_1, a_2, o_2, a_3, \ldots) 的顺序。这形成了一个定义明确的马尔可夫过程,并自然映射到一个线性训练样本。

在套件化智能体强化学习中,套件拥有环境交互循环和消息状态。训练引擎只能观察通过大语言模型端点进行的调用。对于一次展开 \rho,它记录了一个序列 \mathcal{C}(\rho) = \bigl((p_1, a_1), (p_2, a_2), \ldots, (p_{T_\rho}, a_{T_\rho})\bigr),其中 p_i 是提示词元,a_i 是模型采样的确切响应词元。这些调用之间的环境交互和套件状态转换不直接可见。因此,将观察到的调用序列组装成训练样本成为一个建模问题。

这种差异引入了几个实现挑战。现有框架在解决这些问题时做出了不同的选择,这可能影响算法的正确性和训练的稳定性。

更正式地说,传统的智能体强化学习和套件化智能体强化学习都符合部分可观察马尔可夫决策过程公式。它们的区别在于潜在状态和呈现给策略模型的观察。在套件化智能体强化学习中,令 s_t = \bigl(s_t^{\mathrm{harness}}, s_t^{\mathrm{env}}\bigr) 表示由套件和环境共同维护的潜在执行状态。模型不直接观察 s_t。相反,套件构建一个消息级上下文并将其渲染成用于生成的精确词元级提示:C_t^{\mathrm{msg}} = \mathrm{Context}_H\bigl(s_t^{\mathrm{harness}}\bigr)p_t^{\mathrm{tok}} = \mathrm{Tok}\bigl(\mathrm{Template}(C_t^{\mathrm{msg}})\bigr)。因此,每个策略决策被记录为一个调用级转换 z_t = \bigl(p_t^{\mathrm{tok}}, a_t^{\mathrm{tok}}\bigr),其中 a_t^{\mathrm{tok}} \sim \pi_\theta\bigl(\cdot \mid p_t^{\mathrm{tok}}\bigr)。一次展开产生一个可变长度的此类转换集合,并且不假定连续提示之间存在精确的词元前缀关系。为训练执行的任何序列构建都必须保留每个记录动作实际采样时所基于的提示。

接下来,我们描述套件化智能体强化学习特有的几个新挑战。

重新分词和样本合并

为何词元前缀连续性会中断

调用 i 采样的 p_i^{\mathrm{tok}} 具有…

相似文章

Agent Lightning v1.0

Hacker News Top

Agent Lightning v1.0 是微软推出的一个轻量级代理强化学习框架,经过重构以使用真实工具训练AI代理,并实现了显著的基准测试改进,例如在SWE-bench上获得了14.6个百分点的提升。