Agent Lightning v1.0:迈向受控的代理强化学习
摘要
Agent Lightning v1.0 是一个轻量级框架,为代理环境启用可重现的强化学习,显著提升编码代理在如SWE-bench Verified等基准测试上的性能。
查看缓存全文
缓存时间: 2026/08/19 07:57
论文页面 - Agent Lightning v1.0:面向受控智能体强化学习
来源:https://huggingface.co/papers/2608.17528
摘要
Agent Lightning v1.0 可实现针对任意智能体运行环境的可复现强化学习,以极少的数据和算力显著提升编程智能体的性能。
现代智能体在智能体运行环境中运行,这些环境管理工具、上下文和控制流程,使运行环境成为智能体系统的关键组成部分。我们最初的 Agent Lightning 引入了一种解耦架构,通过 LLM 端点代理将任意智能体连接到强化学习训练,这一方法后来被 verl Uni-Agent、AReaL 2.0、slime 和 Polar 等框架所采纳。我们将此范式称为受控智能体强化学习,其中部署时的运行环境直接参与模型的后训练。受控智能体强化学习与传统智能体强化学习存在根本区别:运行环境而非训练引擎拥有环境交互循环,而训练器仅观察到 LLM 请求-响应序列对。这引入了重标记化、样本合并、优势计算、损失归一化和后端调度方面的挑战,这些挑战可能显著影响训练的稳定性和有效性。我们提出了 Agent Lightning v1.0,一个用于受控智能体强化学习的轻量级框架,代码量约 3,500 行。它支持任意智能体运行环境,并作为研究这些挑战的实用测试平台。我们在指令遵循、搜索和编程智能体上对其进行了评估,并为编程智能体强化学习提供了一个完整的可复现流程。仅使用 6K 训练样本和适度的计算资源,强化学习将 Qwen3.5-9B 在 SWE-bench Verified 上的表现从 41.8% 提升至 56.4%,绝对增益达 14.6 个点。我们发布了完整的工作流程和训练脚本,以促进对受控智能体强化学习的可复现研究。
查看 arXiv 页面 (https://arxiv.org/abs/2608.17528)查看 PDF (https://arxiv.org/pdf/2608.17528)项目主页 (https://microsoft.github.io/agent-lightning/stable/)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.17528)
在您的智能体中获取本文:
hf papers read 2608.17528
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型0
没有模型链接到本文
在模型的 README.md 中引用 arxiv.org/abs/2608.17528 以从本页面链接。
引用本文的数据集0
没有数据集链接到本文
在数据集的 README.md 中引用 arxiv.org/abs/2608.17528 以从本页面链接。
引用本文的 Spaces0
没有 Space 链接到本文
在 Space 的 README.md 中引用 arxiv.org/abs/2608.17528 以从本页面链接。
包含本文的收藏夹0
没有收藏夹包含本文
将本文添加到收藏夹 (https://huggingface.co/new-collection)以从本页面链接。
相似文章
Agent Lightning v1.0
Agent Lightning v1.0 是微软推出的一个轻量级代理强化学习框架,经过重构以使用真实工具训练AI代理,并实现了显著的基准测试改进,例如在SWE-bench上获得了14.6个百分点的提升。
Agent Lightning: 使用强化学习训练任何AI智能体
Agent Lightning引入了一个灵活的强化学习框架,用于训练AI智能体中的大型语言模型,实现了智能体执行与训练的解耦,以处理复杂交互。
@omarsar0:微软的这项新工作非常有趣。(收藏起来)这项工作与利用工具进行模型后训练的新兴主题相关…
Agent Lightning v1.0 是微软推出的一个轻量级框架,它将代理工具与强化学习训练相结合,利用适度计算资源提高了 Qwen3.5-9B 在 SWE-bench Verified 上的性能。
ClawGym II:基于代理工具的黑箱强化学习探索
本文提出了一种统一的黑箱强化学习框架,通过沙箱执行与轨迹重建,实现了代理在复杂工具链中稳定、可扩展的优化,并在ClawGym-Bench等基准测试中取得了性能提升。
@_akhaliq: LiteResearcher — 面向深度研究智能体的可扩展代理RL训练框架
LiteResearcher是一个可扩展的强化学习训练框架,专为深度研究智能体设计。