Agent Lightning: 使用强化学习训练任何AI智能体

Papers with Code Trending 论文

摘要

Agent Lightning引入了一个灵活的强化学习框架,用于训练AI智能体中的大型语言模型,实现了智能体执行与训练的解耦,以处理复杂交互。

我们介绍Agent Lightning,一个灵活且可扩展的框架,使基于强化学习 (RL) 的大型语言模型 (LLMs) 训练能够应用于任何AI智能体。与现有将RL训练与智能体紧密耦合或依赖序列拼接和掩码的方法不同,Agent Lightning实现了智能体执行与训练的完全解耦,允许与通过多种方式开发的现有智能体无缝集成(例如,使用LangChain、OpenAI Agents SDK、AutoGen等框架,或从零构建),且几乎不需要代码修改。通过将智能体执行形式化为马尔可夫决策过程,我们定义了一个统一的数据接口,并提出了一种分层RL算法LightningRL,其中包含信用分配模块,使我们能够将任何智能体生成的轨迹分解为训练转移。这使得RL能够处理复杂的交互逻辑,如多智能体场景和动态工作流。在系统设计方面,我们引入了训练-智能体解耦架构,并将智能体可观测性框架引入智能体运行时,提供标准化的智能体微调接口。在文本到SQL、检索增强生成和数学工具使用任务中的实验展示了稳定、持续的改进,突显了该框架在实际智能体训练和部署中的潜力。
查看原文
查看缓存全文

缓存时间: 2026/08/25 04:31

论文页面 - Agent Lightning:基于强化学习训练任意AI智能体

来源:https://huggingface.co/papers/2508.03680

摘要

Agent Lightning是一个灵活的强化学习框架,通过层次化强化学习算法在多种智能体中训练大语言模型,并将执行与训练解耦以处理复杂交互。

我们提出Agent Lightning——一个灵活且可扩展的框架,能够对任意AI智能体中的大语言模型(LLMs)进行基于强化学习(RL)的训练。与现有将强化学习训练与智能体紧密耦合、或依赖序列拼接与掩码处理的方法不同,Agent Lightning实现了智能体执行与训练的完全解耦,可与通过多种方式(例如使用LangChain、OpenAI Agents SDK、AutoGen等框架,或从零构建)开发的现有智能体实现无缝集成,几乎只需零代码修改。通过将智能体执行过程构建为马尔可夫决策过程,我们定义了统一的数据接口,并提出层次化强化学习算法LightningRL。该算法包含信用分配模块,能够将任意智能体生成的轨迹分解为训练转移数据。这使得强化学习能处理复杂的交互逻辑,例如多智能体场景和动态工作流。在系统设计方面,我们引入训练-智能体分离架构,并将智能体可观测性框架引入智能体运行时,提供标准化的智能体微调接口。在文本到SQL、检索增强生成和数学工具使用任务上的实验表明,该框架能实现稳定持续的改进,展示了其在现实世界智能体训练与部署中的潜力。

查看arXiv页面 (https://arxiv.org/abs/2508.03680) 查看PDF (https://arxiv.org/pdf/2508.03680) 项目页面 (https://www.microsoft.com/en-us/research/project/agent-lightning/) GitHub 17.7k (https://github.com/microsoft/agent-lightning) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2508.03680)

通过您的智能体获取本文:

hf papers read 2508.03680

尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型

0 无模型链接本文

在模型README.md中引用arxiv.org/abs/2508.03680以从此页面链接。

引用本文的数据集

0 无数据集链接本文

在数据集README.md中引用arxiv.org/abs/2508.03680以从此页面链接。

引用本文的空间

0 无空间链接本文

在空间README.md中引用arxiv.org/abs/2508.03680以从此页面链接。

包含本文的收藏夹

56 浏览包含本文的56个收藏夹 (https://huggingface.co/collections?paper=2508.03680)

相似文章

Agent Lightning v1.0

Hacker News Top

Agent Lightning v1.0 是微软推出的一个轻量级代理强化学习框架,经过重构以使用真实工具训练AI代理,并实现了显著的基准测试改进,例如在SWE-bench上获得了14.6个百分点的提升。

AgentJet:一个面向智能体强化学习的灵活群组训练框架

arXiv cs.AI

AgentJet 是一个面向大语言模型智能体强化学习的分布式群组训练框架,它将智能体运行与模型优化解耦,支持异构多智能体强化学习、多任务训练、容错以及实时代码迭代,训练速度提升1.5-10倍。该框架还引入了一个自动化研究系统,能够在大型集群上自主进行为期数天的强化学习研究。