Agent Lightning v1.0:迈向受控的代理强化学习

Hugging Face Daily Papers 论文

摘要

Agent Lightning v1.0 是一个轻量级框架,为代理环境启用可重现的强化学习,显著提升编码代理在如SWE-bench Verified等基准测试上的性能。

现代代理在管理工具、上下文和控制流的代理环境中运行,使得环境成为代理系统的关键部分。我们最初的 Agent Lightning 引入了一种解耦架构,通过 LLM 端点代理将任意代理连接到 RL 训练,这种方法后来被诸如 verl Uni-Agent、AReaL 2.0、slime 和 Polar 等框架采用。我们称这种范式为受控的代理强化学习,其中部署时的环境直接参与模型后训练。受控的代理强化学习与传统代理强化学习有根本不同:环境,而非训练引擎,拥有环境交互循环,而训练器仅观察 LLM 请求-响应对的序列。这在重新标记化、样本合并、优势计算、损失归一化和后端调度方面引入了挑战,这些可能显著影响训练稳定性和有效性。我们介绍了 Agent Lightning v1.0,这是一个用大约 3,500 行代码实现的轻量级受控代理强化学习框架。它支持任意代理环境,并作为研究这些挑战的实用测试平台。我们在指令遵循、搜索和编码代理上评估了它,并为编码代理 RL 提供了一个完整的可重现管道。仅使用 6K 训练示例和适度计算,RL 将 Qwen3.5-9B 在 SWE-bench Verified 上的性能从 41.8% 提升至 56.4%,绝对增益为 14.6 个百分点。我们发布了完整的工作流程和训练脚本,以促进受控代理强化学习的可重现研究。
查看原文
查看缓存全文

缓存时间: 2026/08/19 07:57

论文页面 - Agent Lightning v1.0:面向受控智能体强化学习

来源:https://huggingface.co/papers/2608.17528

摘要

Agent Lightning v1.0 可实现针对任意智能体运行环境的可复现强化学习,以极少的数据和算力显著提升编程智能体的性能。

现代智能体在智能体运行环境中运行,这些环境管理工具、上下文和控制流程,使运行环境成为智能体系统的关键组成部分。我们最初的 Agent Lightning 引入了一种解耦架构,通过 LLM 端点代理将任意智能体连接到强化学习训练,这一方法后来被 verl Uni-Agent、AReaL 2.0、slime 和 Polar 等框架所采纳。我们将此范式称为受控智能体强化学习,其中部署时的运行环境直接参与模型的后训练。受控智能体强化学习与传统智能体强化学习存在根本区别:运行环境而非训练引擎拥有环境交互循环,而训练器仅观察到 LLM 请求-响应序列对。这引入了重标记化、样本合并、优势计算、损失归一化和后端调度方面的挑战,这些挑战可能显著影响训练的稳定性和有效性。我们提出了 Agent Lightning v1.0,一个用于受控智能体强化学习的轻量级框架,代码量约 3,500 行。它支持任意智能体运行环境,并作为研究这些挑战的实用测试平台。我们在指令遵循、搜索和编程智能体上对其进行了评估,并为编程智能体强化学习提供了一个完整的可复现流程。仅使用 6K 训练样本和适度的计算资源,强化学习将 Qwen3.5-9B 在 SWE-bench Verified 上的表现从 41.8% 提升至 56.4%,绝对增益达 14.6 个点。我们发布了完整的工作流程和训练脚本,以促进对受控智能体强化学习的可复现研究。

查看 arXiv 页面 (https://arxiv.org/abs/2608.17528)查看 PDF (https://arxiv.org/pdf/2608.17528)项目主页 (https://microsoft.github.io/agent-lightning/stable/)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.17528)

在您的智能体中获取本文:

hf papers read 2608.17528

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型0

没有模型链接到本文

在模型的 README.md 中引用 arxiv.org/abs/2608.17528 以从本页面链接。

引用本文的数据集0

没有数据集链接到本文

在数据集的 README.md 中引用 arxiv.org/abs/2608.17528 以从本页面链接。

引用本文的 Spaces0

没有 Space 链接到本文

在 Space 的 README.md 中引用 arxiv.org/abs/2608.17528 以从本页面链接。

包含本文的收藏夹0

没有收藏夹包含本文

将本文添加到收藏夹 (https://huggingface.co/new-collection)以从本页面链接。

相似文章

Agent Lightning v1.0

Hacker News Top

Agent Lightning v1.0 是微软推出的一个轻量级代理强化学习框架,经过重构以使用真实工具训练AI代理,并实现了显著的基准测试改进,例如在SWE-bench上获得了14.6个百分点的提升。

ClawGym II:基于代理工具的黑箱强化学习探索

Hugging Face Daily Papers

本文提出了一种统一的黑箱强化学习框架,通过沙箱执行与轨迹重建,实现了代理在复杂工具链中稳定、可扩展的优化,并在ClawGym-Bench等基准测试中取得了性能提升。