Agent Lightning: 使用强化学习训练任何AI智能体
摘要
Agent Lightning引入了一个灵活的强化学习框架,用于训练AI智能体中的大型语言模型,实现了智能体执行与训练的解耦,以处理复杂交互。
查看缓存全文
缓存时间: 2026/08/25 04:31
论文页面 - Agent Lightning:基于强化学习训练任意AI智能体
来源:https://huggingface.co/papers/2508.03680
摘要
Agent Lightning是一个灵活的强化学习框架,通过层次化强化学习算法在多种智能体中训练大语言模型,并将执行与训练解耦以处理复杂交互。
我们提出Agent Lightning——一个灵活且可扩展的框架,能够对任意AI智能体中的大语言模型(LLMs)进行基于强化学习(RL)的训练。与现有将强化学习训练与智能体紧密耦合、或依赖序列拼接与掩码处理的方法不同,Agent Lightning实现了智能体执行与训练的完全解耦,可与通过多种方式(例如使用LangChain、OpenAI Agents SDK、AutoGen等框架,或从零构建)开发的现有智能体实现无缝集成,几乎只需零代码修改。通过将智能体执行过程构建为马尔可夫决策过程,我们定义了统一的数据接口,并提出层次化强化学习算法LightningRL。该算法包含信用分配模块,能够将任意智能体生成的轨迹分解为训练转移数据。这使得强化学习能处理复杂的交互逻辑,例如多智能体场景和动态工作流。在系统设计方面,我们引入训练-智能体分离架构,并将智能体可观测性框架引入智能体运行时,提供标准化的智能体微调接口。在文本到SQL、检索增强生成和数学工具使用任务上的实验表明,该框架能实现稳定持续的改进,展示了其在现实世界智能体训练与部署中的潜力。
查看arXiv页面 (https://arxiv.org/abs/2508.03680) 查看PDF (https://arxiv.org/pdf/2508.03680) 项目页面 (https://www.microsoft.com/en-us/research/project/agent-lightning/) GitHub 17.7k (https://github.com/microsoft/agent-lightning) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2508.03680)
通过您的智能体获取本文:
hf papers read 2508.03680
尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型
0 无模型链接本文
在模型README.md中引用arxiv.org/abs/2508.03680以从此页面链接。
引用本文的数据集
0 无数据集链接本文
在数据集README.md中引用arxiv.org/abs/2508.03680以从此页面链接。
引用本文的空间
0 无空间链接本文
在空间README.md中引用arxiv.org/abs/2508.03680以从此页面链接。
包含本文的收藏夹
56 浏览包含本文的56个收藏夹 (https://huggingface.co/collections?paper=2508.03680)
相似文章
Agent Lightning v1.0
Agent Lightning v1.0 是微软推出的一个轻量级代理强化学习框架,经过重构以使用真实工具训练AI代理,并实现了显著的基准测试改进,例如在SWE-bench上获得了14.6个百分点的提升。
Agent Lightning v1.0:迈向受控的代理强化学习
Agent Lightning v1.0 是一个轻量级框架,为代理环境启用可重现的强化学习,显著提升编码代理在如SWE-bench Verified等基准测试上的性能。
@_akhaliq: LiteResearcher — 面向深度研究智能体的可扩展代理RL训练框架
LiteResearcher是一个可扩展的强化学习训练框架,专为深度研究智能体设计。
@tom_doerr: 使用强化学习构建自定义AI代理 https://github.com/agentica-project/rllm…
rLLM 是一个开源框架,通过强化学习对语言代理进行后训练,其发布的重要模型如 DeepSWE-Preview 和 DeepCoder-14B-Preview 取得了最先进的结果。
AgentJet:一个面向智能体强化学习的灵活群组训练框架
AgentJet 是一个面向大语言模型智能体强化学习的分布式群组训练框架,它将智能体运行与模型优化解耦,支持异构多智能体强化学习、多任务训练、容错以及实时代码迭代,训练速度提升1.5-10倍。该框架还引入了一个自动化研究系统,能够在大型集群上自主进行为期数天的强化学习研究。