SCALE:面向智能体工作流调度的可扩展交叉注意力学习与外推方法
摘要
本文提出SCALE,一种面向智能体LLM工作流DAG的深度强化学习调度器,通过交叉注意力与结构化表示正则化,泛化至未见过的集群规模,无需重新训练即可降低响应时间。
arXiv:2606.06820v1 公告类型: 新论文
摘要:智能体大语言模型(LLM)系统将复杂任务分解为工作流有向无环图(DAG),其原语需要在异构集群上调度。现有的深度强化学习(DRL)调度器与固定集群规模绑定,一旦服务器数量变化就需要重新训练。我们提出SCALE(可扩展交叉注意力学习与外推),一种无需微调即可泛化至未见过的集群规模的DRL调度器。SCALE采用交叉注意力指针网络,其中任务特征查询服务器特征,因此架构天然支持任意数量的服务器。然而,我们注意到仅靠置换不变架构并不能保证在新规模下获得良好性能——随着服务器数量增长,注意力特征会出现分布偏移。为应对这一问题,我们引入结构化表示正则化(SRR):一种去相关损失与向标准正态分布的KL惩罚相结合的方法,使特征统计量在输入规模变化时保持稳定。在16节点上训练,直接测试于32和48节点,SCALE在N=48时相比无SRR的相同架构将平均响应时间降低8.9%,证实显式正则化对于缩小规模泛化差距至关重要。
查看缓存全文
缓存时间: 2026/06/08 09:18
# SCALE:可扩展的跨注意力学习与外推方法用于智能体工作流调度 来源:https://arxiv.org/html/2606.06820 Jierui Lan Zixuan Liang Aiji Liang liangajiji@mail\.bnu\.edu\.cn (https://arxiv.org/html/2606.06820v1/mailto:[email protected]) Jinxi He 北京师范大学文理学院,珠海 519087,中国 ###### 摘要 智能体大语言模型(LLM)系统将复杂任务分解为工作流有向无环图(DAG),其基本操作需要在异构集群上进行调度。现有的深度强化学习(DRL)调度器与固定规模的集群绑定,一旦服务器数量发生变化就需要重新训练。我们提出 **SCALE**(可扩展的跨注意力学习与外推方法),这是一种无需微调即可泛化到未见过的集群规模的 DRL 调度器。SCALE 采用跨注意力指针网络,其中任务特征作为查询,服务器特征作为键值对,因此架构本身可接受任意数量的服务器。然而,我们观察到,仅靠置换不变的架构并不能保证在新规模下具有良好的性能——随着服务器数量的增长,注意力特征会发生分布偏移。为了解决这一问题,我们引入了**结构化表示正则化(SRR)**:一种去相关损失与 KL 散度惩罚(趋向标准正态分布)的组合,使得特征统计量在输入规模变化时保持稳定。在 16 节点上训练,直接在 32 和 48 节点上测试,SCALE 在 N=48 时相比没有 SRR 的相同架构平均响应时间降低了 8.9%,这证实了显式正则化对于弥合规模泛化差距是必要的。 ###### 关键词: 工作流调度,跨注意力,可扩展的强化学习 ††期刊:Computer Networks ## 1 引言 智能体大语言模型(LLM)系统不仅仅回答问题。它们感知环境、制定计划、调用外部工具,并在执行出错时自我修正 plaat2025agentic (https://arxiv.org/html/2606.06820#bib.bib1)。这些系统中的规划器将高层目标分解为基本操作的有向无环图(DAG)kim2023llm (https://arxiv.org/html/2606.06820#bib.bib2)——每个节点是一个工具调用,每条边是一个数据依赖关系。这些基本操作如何映射到计算硬件上直接决定了响应延迟和集群利用率。与单模型推理服务不同,这里的集群是异构的,其可用容量在运行时发生变化,并且各个基本操作在内存和计算需求上差异很大。 基于云的任务调度已被广泛研究 armbrust2010view (https://arxiv.org/html/2606.06820#bib.bib3),但该领域的大部分工作针对的是 MapReduce 作业 dean2008mapreduce (https://arxiv.org/html/2606.06820#bib.bib4) 或微服务链 zhang2021sinan (https://arxiv.org/html/2606.06820#bib.bib5),其工作负载结构与智能体 DAG 有本质不同。最近的一些分析 chaudhry2025murakkab (https://arxiv.org/html/2606.06820#bib.bib6), shen2025batch (https://arxiv.org/html/2606.06820#bib.bib7) 指出,传统调度器无法同时捕获 DAG 级别的依赖关系和每个基本操作在计算和内存上的异构性。智能体任务加剧了难度:执行路径是实时决定的,到达是随机的,使得静态资源预留几乎无用 cheng2024slice (https://arxiv.org/html/2606.06820#bib.bib8)。另一个障碍是,当前基于 DRL 的调度器将集群规模编码到其网络架构中,因此服务器数量的任何变化都会迫使进行完整的重新训练 ma2024efficient (https://arxiv.org/html/2606.06820#bib.bib9)。为这种场景设计调度器带来了两个具体困难。 **表示异构、可变规模的状态。** 集群状态混合了任务级属性(计算需求、内存占用)和服务器级属性(容量、当前负载),服务器数量 N 可能在训练和部署之间不同。标准 MLP 策略网络 schulman2017proximal (https://arxiv.org/html/2606.06820#bib.bib10) 接受固定维度的输入,因此当 N 变化时它们会直接失效。图神经网络(GNN)可以编码任务依赖关系 liu2024ga (https://arxiv.org/html/2606.06820#bib.bib11),但将任务和服务器特征合并到一个图中会带来大量计算开销。 参考图1:智能体工作流调度的系统架构。工作流 DAG 动态到达并收集在就绪基本操作缓冲区中。一个两层调度器——启发式最长路径选择,然后是 RL 代理——将基本操作分配给异构服务器集群,最小化平均响应时间和通信延迟。 参考图2:具有 SRR 的 SCALE 算法架构。一个两层跨注意力骨干网络将基本操作特征(查询)与服务器特征(键值对)集成。得到的表示输入到指针 Actor(对服务器分数进行 softmax)和 Value Critic,两者都通过 PPO 训练。 **跨集群规模泛化。** 我们希望在小集群(N=16)上训练,并部署到更大的集群(N=32、48 或更大)而无需重新训练。在实践中,在一个规模上学习到的策略在另一个规模上会退化,因为潜在特征会发生分布偏移。在基于注意力的架构 vaswani2017attention (https://arxiv.org/html/2606.06820#bib.bib12) 中,聚合表示的方差随着键集的大小增长,导致特征维度变得冗余和相关。一旦输入集超过训练时见过的规模,策略就会变得脆弱。 我们通过 **可扩展的跨注意力学习与外推方法(SCALE)** 解决了这两个问题。图1 (https://arxiv.org/html/2606.06820#S1.F1) 和图2 (https://arxiv.org/html/2606.06820#S1.F2) 分别显示了系统概览和算法架构。核心机制是跨注意力:当前任务的特征作为查询,所有服务器状态构成键值集合,使得模型能够接受任意数量的服务器而无需修改。在此之上,指针网络 vinyals2015pointer (https://arxiv.org/html/2606.06820#bib.bib13) 通过查询-键点积计算选择分数,输出维度等于当前的 N。主要的技术贡献是 **结构化表示正则化(SRR)**——对注意力特征的非对角线协方差施加去相关惩罚,并搭配一个 KL 项使每个维度的边缘分布趋向 N(0,1)。SRR 防止特征统计量随着 N 增长而漂移,因此一个在 N=16 上训练的模型可以在 N=32 或 48 上运行而无需任何微调。 我们在一个异构模拟集群上评估 SCALE,在 N=16 上训练,在 N=32 和 48 上测试,无微调。我们与几个 DRL 基线进行比较,并消融 SRR 对泛化的贡献。 我们的贡献如下: 1. 将智能体工作流调度形式化为一个在异构集群上动态到达 DAG 的马尔可夫决策过程(MDP),同时捕获任务依赖关系、资源异构性和通信开销。 2. SCALE 算法——一个增强 SRR 的跨注意力指针网络——实现了跨集群规模的零样本泛化。 3. 实验证据表明,在 N=16 上训练的 SCALE 在 N=32 和 48 上保持了有竞争力的响应时间,而没有 SRR 的相同架构则明显退化。 本文的其余部分组织如下。第2节 (https://arxiv.org/html/2606.06820#S2) 回顾相关工作。第3节 (https://arxiv.org/html/2606.06820#S3) 形式化系统模型。第4节 (https://arxiv.org/html/2606.06820#S4) 描述 SCALE。第5节 (https://arxiv.org/html/2606.06820#S5) 介绍实验。第6节 (https://arxiv.org/html/2606.06820#S6) 讨论局限性,第7节 (https://arxiv.org/html/2606.06820#S7) 总结。 ## 2 相关工作 **智能体 LLM 系统。** 智能体 LLM 系统迭代地分解目标、调用工具,并基于中间结果修改其计划——远远超越了单轮生成。AutoGPT significantgravitas2023autogpt (https://arxiv.org/html/2606.06820#bib.bib14) 展示了完全由 LLM 驱动的递归任务分解。LangChain chase2022langchain (https://arxiv.org/html/2606.06820#bib.bib15) 引入了用于工具调用、内存管理和思维链编排的可重用抽象。MetaGPT hong2024metagpt (https://arxiv.org/html/2606.06820#bib.bib16) 为协作代理分配了不同的角色,模拟了结构化开发过程。 从调度角度来看,关键观察是这些工作流是 DAG。LangGraph langchain2024langgraph (https://arxiv.org/html/2606.06820#bib.bib17) 和 AutoGen wu2023autogen (https://arxiv.org/html/2606.06820#bib.bib18) 明确将代理交互表示为具有条件分支和并行路径的图。节点是工具调用或推理步骤;边是数据依赖关系。不同的工具调用——代码执行、API 查询、数据库查找——表现出截然不同的延迟和资源占用,并发活跃代理的数量快速波动。然而,现有的编排框架假设一个固定的计算池,不会根据变化的集群调整调度。我们的方法将服务器集合视为可变大小的输入,并学习一个适应任意集群配置的策略。 **工作流调度。** 分布式集群上的 DAG 调度已经研究了数十年。经典的列表启发式算法 HEFT 和 CPOP 1999a (https://arxiv.org/html/2606.06820#bib.bib19) 运行时间为 O(v²p)(v 个任务,p 个处理器),并产生良好的最大完工时间,但它们要求处理器集是固定的且事先已知。两者都无法对运行时节点加入或离开做出反应。 DRL 引入了可学习的调度策略。DeepRM mao2016deeprm (https://arxiv.org/html/2606.06820#bib.bib20) 使用全连接策略网络将作业装箱到机器上。Decima mao2019decima (https://arxiv.org/html/2606.06820#bib.bib21) 进一步使用 GNN 编码 DAG 结构,在数据流工作负载上优于手动调优的启发式算法。然而,两者都是针对特定的集群规模训练的——它们的策略网络具有固定的输出维度,当 N 变化时不能重用。多目标变体也有此限制。我们的工作针对弹性集群,其中节点可能由于自动缩放、抢占或故障而被添加或移除,需要一种无需重新训练就能跨规模泛化的调度器。 **面向可变大小问题的可扩展强化学习。** 将 RL 应用于调度的根本困难在于任务图和服务器集都会在实例间变化。固定维度的 MLP 策略在问题规模变化时就会失效。有两类工作来解决这个问题。 一类依赖于置换不变的编码器。GCN kipf2017gcn (https://arxiv.org/html/2606.06820#bib.bib22) 处理图结构输入,已被纳入调度策略。对于无序集合(例如可用机器),Deep Sets zaheer2017deep (https://arxiv.org/html/2606.06820#bib.bib23) 和 Set Transformers lee2019set (https://arxiv.org/html/2606.06820#bib.bib24) 提供了输出独立于输入排序的架构。 另一类利用注意力进行组合优化。Attention Model kool2019attention (https://arxiv.org/html/2606.06820#bib.bib25) 用单个训练好的模型解决了不同规模的车辆路径问题和 TSP 问题;类似的思想出现在作业车间调度 park2021jobshop (https://arxiv.org/html/2606.06820#bib.bib26) 中。自注意力可以处理可变基数,因为 softmax 会对存在的任何集合进行归一化。 在小实例上训练并部署到大实例——规模泛化——已通过课程学习和规模不变的结构偏差进行探索 bengio2021ml4co (https://arxiv.org/html/2606.06820#bib.bib27),但仍然是一个开放问题。我们将单个任务查询与可变大小服务器键集之间的跨注意力与显式特征正则化相结合,实现了跨集群规模的零样本迁移。 ## 3 问题形式化 我们考虑在异构计算集群上对智能体工作流进行在线调度。工作流随时间到达,每个工作流由相互依赖的基本操作组成。调度器实时将就绪的基本操作分配给服务器,目标是在资源约束和依赖顺序的约束下最小化平均响应时间。 ### 3.1 工作流模型 设 W = {W₁, W₂, …} 表示在系统运行期间到达的工作流集合。每个工作流 Wₖ 表示为一个有向无环图(DAG)Gₖ = (Vₖ, Eₖ),其中: - 1. Vₖ 是**基本操作**(原子执行单元)的集合。每个基本操作 vᵢ ∈ Vₖ 由一个元组 (cᵢ, mᵢ, dᵢ) 表征: - (a) cᵢ > 0:计算需求(以 GFLOPS 计), - (b) mᵢ > 0:内存需求(以 GB 计), - (c) dᵢ ≥ 0:输出数据量(以 GB 计),将传输给后继任务。 - 2. Eₖ ⊆ Vₖ × Vₖ 是表示数据依赖关系的有向边集合。边 (vᵢ, vⱼ) ∈ Eₖ 表示 vⱼ 依赖于 vᵢ 的完成。 节点 vⱼ 的**前驱集**为 Γ⁻(vⱼ) = {vᵢ ∈ Vₖ : (vᵢ, vⱼ) ∈ Eₖ}。当 vⱼ 的所有前驱都完成执行时,即 Γ⁻(vⱼ) ⊆ D(t),其中 D(t) 是时间 t 之前已完成的任务集合,vⱼ 变为**就绪**状态。时间 t 的就绪集为 R(t) = { vⱼ ∈ ⋃ₖ Vₖ \ D(t) : Γ⁻(vⱼ) ⊆ D(t) }, 这构成了该时刻唯一可调度的任务。R(t) 的组成随着任务完成和新工作流到达而动态变化。工作流到达服从泊松过程;到达率可能随系统负载变化。 ### 3.2 集群模型 计算集群由一组服务器 H = {h₁, …, hₙ} 组成,其中 N 可能由于自动缩放、抢占或故障而随时间变化。每个服务器 hⱼ 由其资源容量 (Cⱼ, Mⱼ) 表征: - 1. Cⱼ > 0:计算容量(以 GFLOPS 计), - 2. Mⱼ > 0:内存容量(以 GB 计)。 服务器是异构的;容量可能相差几个数量级。 每个服务器一次最多执行一个基本操作。一个空闲且满足内存约束 mᵢ ≤ Mⱼ 的服务器 hⱼ 可以接受任务 vᵢ 的分配。一旦分配,vᵢ 在 hⱼ 上的**执行时间**为 τᵢⱼ = cᵢ / Cⱼ。 如果依赖边 (vᵢ, vⱼ) ∈ Eₖ 的前驱 vᵢ 被分配到服务器 hₚ,后继 vⱼ 被分配到不同的服务器 h_q(p ≠ q),则跨服务器数据传输会产生**通信开销** δᵢⱼ = dᵢ / B + L, 其中 B 是集群网络带宽(GB/s),L 是基础网络延迟(s)。如果 p = q,则 δᵢⱼ = 0。
相似文章
学习适应:基于认知感知探索的自我改进网络智能体
提出了SCALE框架,用于自我改进的网络智能体,采用认知感知探索,包含三个对抗角色和图探索策略。同时介绍了从真实网站收集的大规模数据集SCALE-20k,显著提升了基于MLLM的网络智能体的性能。
协调实时约束与长期推理:面向动态调度的异步智能体框架
本文介绍了RACE-Sched,一种异步智能体框架,它将实时反应式调度与基于LLM的深思熟虑推理解耦,以处理动态作业车间调度问题,在DRL和其他基准方法上取得了更优的性能。
基于滑动窗口的强化学习方法用于具有多产品交付的动态装配流水车间调度
本文提出了一种基于滑动窗口的强化学习框架(SWRL),用于在具有复杂配套约束的动态装配流水车间调度中实现端到端的在线调度,在实际实例上,相较于经典调度规则和现有深度强化学习方法,该方法在减少延迟方面表现出一致的优势。
@SharonYixuanLi:扩展基于结果的强化学习无法解决长周期智能体任务。信用分配是瓶颈,而轮次级奖励…
TRACE 提出了一种轮次级奖励分配方法,利用冻结参考模型的对数概率和时间差分学习来解决长周期智能体任务中的信用分配问题,在没有评论家或过程标签的情况下,在搜索基准测试中取得了显著改进。
多智能体RL何时能提升LLM工作流?工作流、规模与策略共享的权衡
本文研究了端到端强化学习训练何时能改善多智能体LLM工作流,比较了不同工作流、任务和模型规模下的共享策略与隔离策略训练,揭示了条件性权衡。