EASy:迈向基于LLM的高效智能体系统
摘要
本文提出了EASy,一个可训练的智能体框架,利用强化学习联合优化任务性能与计算效率,并引入了里程碑-规划-执行工作流、依赖感知执行图和用于训练的树形展开。
arXiv:2608.04588v1 公告类型:新
摘要:智能体系统已成为一种有前景的范式,通过协调专门的基于LLM的智能体来解决复杂任务。然而,大多数现有系统主要优化任务成功率,而在实际约束(如执行器能力和计算成本)下对执行效率的考虑有限。现有的基于路由器的方法在推理丰富且不断变化的任务上下文、多步依赖和中间执行反馈方面的能力有限,并且通常对未见过的执行器泛化能力较差。我们提出了EASy,一个可训练的智能体框架,通过强化学习联合优化任务性能和计算效率。EASy为基于LLM的编排器提供异构执行器的能力和成本配置文件的显式知识,从而实现超越仅性能路由的上下文敏感协调。它还引入了里程碑-规划-执行工作流,将复杂任务分解为可管理的里程碑,构建依赖感知的执行图,分配合适的执行器,并行化独立步骤,同时根据中间结果调整后续决策。为了训练编排器,我们开发了一种树形展开(rollout)程序,探索替代的里程碑分解和执行计划,并配合多组件奖励,以捕获任务正确性、执行效率和轨迹完整性。在数学推理、具身决策和深度研究基准上的大量实验表明,EASy在性能-效率权衡方面始终优于强智能体基线。
查看缓存全文
缓存时间: 2026/08/06 07:49
# EASy:迈向高效的基于 LLM 的智能体系统 Source: https://arxiv.org/html/2608.04588 Junnan Liu, Linhao Luo, Thuy-Trang Vu & Gholamreza Haffari Department of Data Science and AI, Faculty of Information Technology, Monash University, Australia [email protected] ###### 摘要 智能体系统已成为一种有前景的范式,通过协调基于 LLM 的专门智能体来解决复杂任务。然而,大多数现有系统主要优化任务成功率,而对执行器能力和计算成本等实际约束下的执行效率关注有限。现有的基于路由器的方法难以对丰富且不断演化的任务上下文、多步依赖和中间执行反馈进行推理,并且通常无法泛化到未见过的执行器。我们提出 **EASy**,一个可训练的智能体框架,通过强化学习联合优化任务性能和计算效率。EASy 为基于 LLM 的编排器提供异构执行器的能力和成本概况的显式知识,使其能够超越仅基于性能的路由,做出上下文敏感的协调决策。它还引入了里程碑-规划-执行(milestone-plan-act)工作流,将复杂任务分解为可管理的里程碑,构建依赖感知的执行图,为各个步骤分配合适的执行器,并尽可能并行执行独立步骤,同时根据中间结果调整后续决策。为了训练编排器,我们开发了一种树结构 rollout 过程,探索替代的里程碑分解和执行计划,并配合多组件奖励,以捕获任务正确性、执行效率和轨迹完整性。在数学推理、具身决策和深度研究基准上的大量实验表明,EASy 在性能-效率权衡上持续优于强大的智能体基线。 ### 1 引言 智能体系统已成为一种有前景的范式,通过整合大语言模型(LLMs)来解决复杂任务([OpenAI,2024a](https://arxiv.org/html/2608.04588#bib.bib38);[OpenAI,2024b](https://arxiv.org/html/2608.04588#bib.bib39);[OpenAI,2025b](https://arxiv.org/html/2608.04588#bib.bib41);[DeepSeek-AI 等,2025](https://arxiv.org/html/2608.04588#bib.bib5);[Kimi-Team 等,2025](https://arxiv.org/html/2608.04588#bib.bib23);[Yang 等,2025](https://arxiv.org/html/2608.04588#bib.bib67);[Comanici 等,2025](https://arxiv.org/html/2608.04588#bib.bib4);[Huang & Yang,2025](https://arxiv.org/html/2608.04588#bib.bib17);[xAI,2025](https://arxiv.org/html/2608.04588#bib.bib64))。通过协调基于 LLM 的专门智能体,这些系统将规划、推理、工具使用、执行和验证分布到互补的组件上,从而提升了在数学推理、具身决策和深度研究等挑战性任务上的性能([Shinn 等,2023](https://arxiv.org/html/2608.04588#bib.bib52);[Wang 等,2024](https://arxiv.org/html/2608.04588#bib.bib58);[Qian 等,2025b](https://arxiv.org/html/2608.04588#bib.bib48);[Schick 等,2023](https://arxiv.org/html/2608.04588#bib.bib50))。近期在可验证奖励强化学习(RLVR)方面的进展进一步增强了 LLM 智能体的推理和决策能力,使智能体工作流在长周期和工具密集型任务上越来越可行([Pu 等,2023](https://arxiv.org/html/2608.04588#bib.bib45);[Zhang & Soh,2024](https://arxiv.org/html/2608.04588#bib.bib73);[Gupta 等,2024](https://arxiv.org/html/2608.04588#bib.bib12);[Xu 等,2024](https://arxiv.org/html/2608.04588#bib.bib65))。 早期的智能体系统通常依赖固定的组织结构,智能体遵循预定义的角色、通信协议或执行流水线([Wu 等,2023](https://arxiv.org/html/2608.04588#bib.bib63);[Hong 等,2024](https://arxiv.org/html/2608.04588#bib.bib14);[Hu 等,2025](https://arxiv.org/html/2608.04588#bib.bib16))。虽然对于定义明确的任务很有效,但此类静态工作流在面对复杂问题时往往力不从心,因为这些问题在求解过程中会不断演化推理需求、交互模式和执行上下文。这一局限性促使研究转向动态组织的智能体系统,其协调策略会适应任务需求和中间上下文。特别是,异构智能体系统采用编排器来分解任务、分配子任务,并根据中间结果协调执行([Liu 等,2024](https://arxiv.org/html/2608.04588#bib.bib30);[Guo 等,2024](https://arxiv.org/html/2608.04588#bib.bib11);[Li 等,2024a](https://arxiv.org/html/2608.04588#bib.bib27);[Fu 等,2024](https://arxiv.org/html/2608.04588#bib.bib10);[
相似文章
学习构建实用的智能体系统
本文提出了设计和优化实用智能体LLM系统的原则性方法,引入了一个包含伪工具和固定工作流的框架,以提高模块化、成本效益和跨多种任务的准确性。
超越静态评估:构建用于可扩展智能体强化学习的仿真环境
介绍AgenticAI-Supervisor,一个基于API和UI驱动的仿真环境,用于LLM智能体的可扩展强化学习,通过可验证的执行结果和奖励塑造来缓解奖励破解。
AutoLLMResearch:通过从低成本学习来优化高成本,训练研究智能体以自动化大型语言模型实验配置
本文介绍了 AutoLLMResearch,这是一个智能体框架,旨在通过在低保真环境中学习并外推至高成本设置,实现昂贵的大型语言模型(LLM)实验配置的自动化。其目标是减少可扩展 LLM 研究中的计算浪费以及对专家直觉的依赖。
从动作引导中学习智能体策略
本文提出了 ActGuide-RL,这是一种利用人类动作数据作为指导来训练大语言模型(LLM)智能体策略的方法,旨在无需大量监督微调的情况下克服强化学习中的探索障碍。
智能体LLM系统的共享选择性持久记忆
本文介绍了面向智能体LLM系统的共享选择性持久记忆,该记忆保留可复用的上下文(如任务规范和数据模式),同时丢弃会话特定的推理痕迹,在企业场景中实现了96%的任务完成率和显著的令牌成本降低。