面向LLM赋能代理工作流的可靠设计:优化延迟-可靠性-成本权衡

arXiv cs.AI 论文

摘要

本文分析了LLM赋能代理工作流中延迟、可靠性和成本之间的权衡,引入了性能模型,并推导出了如注水令牌分配等最优资源分配策略。

arXiv:2605.23929v1 公告类型:新 摘要:现代人工智能系统越来越依赖于由多个交互代理组成的工作流,其中一些由大语言模型(LLM)驱动,另一些由传统计算模块驱动。本文分析了LLM赋能代理工作流中延迟、可靠性和成本之间的基本权衡。我们为LLM和非LLM代理引入了性能模型,捕捉计算努力与输出质量之间的关系,并通过参数化指数可靠性函数纳入了LLM代理的推理和输出令牌的影响。然后,我们研究了在延迟和成本约束下顺序工作流的设计。主要结果包括注水令牌分配策略,以及基于影子价格的最优工作流可靠性表征。
查看原文
查看缓存全文

缓存时间: 2026/05/26 08:59

# 面向LLM赋能的智能体工作流的可靠设计:优化延迟-可靠性-成本权衡
来源:https://arxiv.org/html/2605.23929

###### 摘要

现代AI系统日益依赖于由多个相互交互的智能体组成的工作流,其中部分智能体由大型语言模型(LLM)驱动,其余则由传统计算模块构成。本文分析了LLM赋能的智能体工作流在延迟、可靠性和成本之间的基本权衡。我们为LLM和非LLM智能体引入了性能模型,这些模型捕捉了计算投入与输出质量之间的关系,并通过参数化指数可靠性函数纳入了LLM智能体中推理和输出令牌的影响。随后,我们研究了在延迟和成本约束下的顺序工作流设计。主要结果包括一种注水式令牌分配策略,以及以影子价格形式表征的最优工作流可靠性。

## 1 引言

随着人工智能(AI)的最新进展,特别是大型语言模型(LLM),现代系统日益依赖于由多个相互交互的智能体组成的工作流。在这些系统中,智能体通过交换中间信息并逐步精炼其输出来协作解决复杂任务[1 (https://arxiv.org/html/2605.23929#bib.bib2),6 (https://arxiv.org/html/2605.23929#bib.bib7)]。这些智能体可能包括基于LLM的组件以及传统计算模块,例如数据库查询、优化求解器和验证工具。随着这些工作流的规模和复杂性增长,其部署也变得越来越资源密集。这带来了如何在高效且可靠地配置LLM赋能的系统方面的基本挑战。在实践中,系统设计通常由启发式方法或代价高昂的试错法指导。因此,需要数学化和原理性的框架来分析和优化智能体LLM工作流。

从系统角度来看,工作流性能可以通过三个关键量来表征:延迟、可靠性和成本。优化这些性能指标需要理解各个智能体特性如何组合起来决定整体工作流行为。本研究为LLM赋能的智能体工作流开发了性能模型,并推导了在延迟和成本约束下的最优资源分配策略。我们引入了参数化模型,这些模型捕捉了LLM和非LLM智能体在计算投入与输出质量之间的关系。然后,我们专注于顺序工作流,将设计问题形式化为在资源预算约束下最大化可靠性,并使用凸优化方法推导出闭式分配策略[2 (https://arxiv.org/html/2605.23929#bib.bib3)]。我们的结果为设计者提供了配置基于LLM的系统以实现所需性能权衡的原则性方法。

## 2 LLM智能体工作流

一个LLM智能体工作流可以表示为一个有向计算图,其中节点对应智能体,边表示信息流。任务以输入消息的形式进入工作流,通过智能体传播,最终产生输出。

### 2.1 LLM智能体性能指标

在实践中,LLM智能体的执行涉及两个不同的计算阶段。智能体首先执行内部推理以构建任务的解决方案。然后,它生成一系列令牌,将解决方案传达给下游智能体或用户。这两个阶段都消耗计算资源,因此影响延迟、可靠性和成本。考虑一个索引为 j j 的LLM智能体,我们定义两个关键资源变量: Xj X_{j} 表示在推理过程中内部生成的“推理令牌”数量,而 Lj L_{j} 表示最终响应的“输出令牌”数量。这两个量都以令牌为单位测量。变量 Xj X_{j} 代表内部计算投入,而 Lj L_{j} 决定了传达响应的长度。

**延迟**:LLM智能体的延迟取决于网络条件、系统调度以及模型执行的可变性。我们将智能体 j j 的延迟建模为一个以时间单位(例如,秒)测量的随机变量 Tj T_{j} 。延迟由两部分组成:基础设施延迟和模型推理。基础设施延迟记为 τj \tau_{j} ,它捕捉了网络传输和编排开销。该量被视为一个均值为 τ ̄j=E[τj] \bar{\tau}_{j}=\mathbb{E}[\tau_{j}] 的随机变量。在模型推理期间,不同阶段的处理速率不同[4 (https://arxiv.org/html/2605.23929#bib.bib6)]。我们用 λth \lambda_{\text{th}} 表示推理令牌的平均处理速率,用 λgen \lambda_{\text{gen}} 表示输出令牌的平均生成速率。智能体 j j 的总延迟为 Tj=τj+Xjλth+Ljλgen T_{j}=\tau_{j}+\frac{X_{j}}{\lambda_{\text{th}}}+\frac{L_{j}}{\lambda_{\text{gen}}} ,其中第一项捕获随机的基础设施延迟,其余项表示确定性的计算时间。取期望得到平均延迟

T ̄j=τ ̄j+(Xj/λth)+(Lj/λgen), \bar{T}_{j}=\bar{\tau}_{j}+(X_{j}/\lambda_{\text{th}})+(L_{j}/\lambda_{\text{gen}}),(1) 我们在后续分析中将其用作延迟指标。

**可靠性**:智能体 j j 的可靠性定义为该智能体产生的输出是可接受的概率。我们定义可靠性函数 ρj:R+2→[0,1] \rho_{j}:\mathbb{R}^{2}_{+}\to[0,1] 为 ρj(Xj,Lj)=Pr⁡(output of j is acceptable|Xj,Lj) \rho_{j}(X_{j},L_{j})=\Pr(\text{output of }j\text{ is acceptable}|X_{j},L_{j}) 。该函数捕捉了智能体输出质量如何取决于分配给推理和生成的计算资源。通常,增加推理投入 Xj X_{j} 会提高内部解决方案的质量;增加输出长度 Lj L_{j} 可能会增强结果的清晰度、解释或验证[5 (https://arxiv.org/html/2605.23929#bib.bib5)]。为了捕捉两个维度的边际收益递减,我们采用以下参数化形式:

ρj(Xj,Lj)=(1−e−αjXj)(1−e−βjLj), \rho_{j}(X_{j},L_{j})=\big(1-e^{-\alpha_{j}X_{j}}\big)\big(1-e^{-\beta_{j}L_{j}}\big),(2) 其中 αj>0 \alpha_{j}>0 和 βj>0 \beta_{j}>0 是以 (tokens)−1 (\text{tokens})^{-1} 为单位的智能体特定参数。这一选择确保指数函数的参数是无量纲的,并且 ρj(Xj,Lj)∈[0,1] \rho_{j}(X_{j},L_{j})\in[0,1] 。

**成本**:在基于LLM的系统中存在两种不同的成本概念。首先,用户可见成本与生成的输出令牌数量相关。我们用 ctok>0 c_{\text{tok}}>0 表示每个输出令牌的价格,以每令牌货币单位衡量。智能体 j j 的产生的用户成本为 Cju(Lj)=ctokLj C^{u}_{j}(L_{j})=c_{\text{tok}}L_{j} 。其次,系统提供者在处理令牌时会产生计算成本。由于推理令牌和输出令牌都必须由模型处理,所以总令牌工作负载等于 Xj+Lj X_{j}+L_{j} 。令 ccomp>0 c_{\text{comp}}>0 表示每个处理令牌的计算成本(以每令牌货币单位计)。相应的计算成本为 Cjc(Xj,Lj)=ccomp(Xj+Lj) C^{c}_{j}(X_{j},L_{j})=c_{\text{comp}}(X_{j}+L_{j}) 。

### 2.2 非LLM智能体性能指标

非LLM智能体通常对结构化输入执行确定性的或算法性的计算,并不生成令牌序列。在许多情况下,智能体 i i 的延迟 Ti T_{i} 可以使用排队论抽象来建模。例如,如果服务时间服从速率为 λi \lambda_{i} (以 (time)−1 (\text{time})^{-1} 为单位)的指数分布,则预期延迟为 E[Ti]=1/λi \mathbb{E}[T_{i}]=1/\lambda_{i} 。智能体的可靠性定义为在给定有效输入的情况下,智能体产生正确输出的概率,记为 ρi∈[0,1] \rho_{i}\in[0,1] 。因此,对 (Ti,ρi) (T_{i},\rho_{i}) 提供了非LLM智能体延迟和可靠性特性的紧凑表示。

### 2.3 工作流聚合

智能体工作流以不同的结构配置组合异构智能体。令 k k 表示任意一个智能体,其延迟为 Tk T_{k} ,可靠性为 ρk∈[0,1] \rho_{k}\in[0,1] 。工作流的性能不仅取决于单个智能体的特性,还取决于智能体交互的结构配置。我们考虑三种常见配置:顺序组合、并行组合和反馈(迭代)循环。

**顺序**:在顺序配置中,一个智能体的输出成为下一个智能体的输入。考虑一个由 k=1,...,n k=1,\ldots,n 索引的 n n 个智能体的流水线。由于每个阶段必须在前一阶段完成后才能开始,因此预期工作流延迟为 E[Tseq]=∑k=1nE[Tk] \mathbb{E}[T_{\text{seq}}]=\sum_{k=1}^{n}\mathbb{E}[T_{k}] 。工作流只有在所有智能体都成功时才产生正确结果,因此可靠性为 Rseq=∏k=1nρk R_{\text{seq}}=\prod_{k=1}^{n}\rho_{k} 。

**并行**:在并行配置中,多个智能体同时处理相同的输入。并行阶段的延迟由关键路径决定。对于两个智能体 i i 和 j j ,预期延迟为 E[Ti∥j]=E[max⁡(Ti,Tj)] \mathbb{E}[T_{i\|j}]=\mathbb{E}[\max(T_{i},T_{j})] 。然而,可靠性取决于输出的聚合方式。如果工作流成功需要两个输出,则可靠性为 Ri∥j=ρiρj R_{i\|j}=\rho_{i}\rho_{j} 。相反,如果只要至少一个分支产生正确结果工作流就成功,则可靠性变为 Ri∥j=1−(1−ρi)(1−ρj) R_{i\|j}=1-(1-\rho_{i})(1-\rho_{j}) 。这两种情况分别对应于合取和冗余的并行执行模式。

**反馈**:许多智能体工作流采用迭代推理,其中智能体反复交换信息以精炼解决方案。这种结构出现在辩论系统、验证循环和迭代规划中。考虑一个反馈循环,其中智能体 i i 和 j j 按 i→j i\to j 的顺序执行 K K 次迭代。每次迭代的延迟为 Ti+Tj T_{i}+T_{j} ,因此 K K 次迭代后的预期延迟为 E[Tfb]=K(E[Ti]+E[Tj]) \mathbb{E}[T_{\text{fb}}]=K(\mathbb{E}[T_{i}]+\mathbb{E}[T_{j}]) 。如果两个智能体必须在每次迭代中都产生正确输出,则可靠性变为 Rfb=(ρiρj)K R_{\text{fb}}=(\rho_{i}\rho_{j})^{K} 。

## 3 性能优化

现在我们转向优化智能体工作流的设计问题。在本文中,我们专注于顺序组合的情况。值得注意的是,研究顺序工作流并不丧失一般性:由并行或反馈结构构建的更复杂的架构可以看作是复合模块的顺序组合,其中每个模块对应一个子工作流,其延迟和可靠性由第2.3节 (https://arxiv.org/html/2605.23929#S2.SS3) 中引入的聚合规则确定。

考虑一个顺序工作流,由索引为 k=1,...,n k=1,\ldots,n 的智能体组成。令 ALLM \mathcal{A}_{\text{LLM}} 表示LLM智能体的集合, ANLLM \mathcal{A}_{\text{NLLM}} 表示非LLM智能体的集合。对于非LLM智能体 i∈ANLLM i\in\mathcal{A}_{\text{NLLM}} ,预期延迟 E[Ti] \mathbb{E}[T_{i}] 和可靠性 ρi \rho_{i} 是由系统实现确定的固定参数。对于LLM智能体 j∈ALLM j\in\mathcal{A}_{\text{LLM}} ,响应长度 Lj L_{j} 是由系统设计者选择的决策变量。对于LLM智能体,预期延迟 E[Tj(Lj)] \mathbb{E}[T_{j}(L_{j})] 遵循 (1 (https://arxiv.org/html/2605.23929#S2.E1)),可靠性 ρj(Lj) \rho_{j}(L_{j}) 遵循 (2 (https://arxiv.org/html/2605.23929#S2.E2))。

由于智能体顺序运行,工作流的预期延迟等于各个预期延迟之和, E[Twf(L)]=∑i∈ANLLME[Ti]+∑j∈ALLME[Tj(Lj)] \mathbb{E}[T_{\text{wf}}(L)]=\sum_{i\in\mathcal{A}_{\text{NLLM}}}\mathbb{E}[T_{i}]+\sum_{j\in\mathcal{A}_{\text{LLM}}}\mathbb{E}[T_{j}(L_{j})] 。然后,假设各智能体的失败是独立的,工作流可靠性等于流水线中所有智能体的可靠性之积。对于非LLM智能体 i∈ANLLM i\in\mathcal{A}_{\text{NLLM}} ,可靠性 ρi∈[0,1] \rho_{i}\in[0,1] 是由系统实现确定的固定参数。对于LLM智能体 j∈ALLM j\in\mathcal{A}_{\text{LLM}} ,可靠性取决于推理投入 Xj X_{j} 和输出长度 Lj L_{j} 。因此,整体工作流可靠性为 Rwf(X,L)=∏i∈ANLLMρi∏j∈ALLMρj(Xj,Lj) R_{\text{wf}}(X,L)=\prod_{i\in\mathcal{A}_{\text{NLLM}}}\rho_{i}\prod_{j\in\mathcal{A}_{\text{LLM}}}\rho_{j}(X_{j},L_{j}) 。

在后续分析中,我们将推理分配 Xj X_{j} 视为由每个智能体的内部推理策略确定的固定参数。因此,我们引入简化可靠性函数 ρ^j(Lj):=ρj(Xj,Lj) \hat{\rho}_{j}(L_{j}):=\rho_{j}(X_{j},L_{j}) ,它仅依赖于响应长度 Lj L_{j} 。在此假设下,工作流可靠性变为 Rwf(L)=∏i∈ANLLMρi∏j∈ALLMρ^j(Lj) R_{\text{wf}}(L)=\prod_{i\in\mathcal{A}_{\text{NLLM}}}\rho_{i}\prod_{j\in\mathcal{A}_{\text{LLM}}}\hat{\rho}_{j}(L_{j}) 。

### 3.1 延迟-成本约束设计

假设工作流必须同时满足延迟约束 T T 和用户成本预算 C C 。系统设计者选择LLM智能体的响应长度 Lj L_{j} 以最大化工作流的可靠性。由此产生的设计问题可以写成

maxLj,j∈ALLM\displaystyle\max_{L_{j},j\in\mathcal{A}_{\text{LLM}}}∏j∈ALLMρ^j(Lj)\displaystyle\prod_{j\in\mathcal{A}_{\text{LLM}}}\hat{\rho}_{j}(L_{j})(3)
s.t.∑j∈ALLMLjλgen≤T−Tfixed,∑j∈ALLMCju(Lj)≤C,\displaystyle\sum_{j\in\mathcal{A}_{\text{LLM}}}\frac{L_{j}}{\lambda_{\text{gen}}}\leq T-T_{\text{fixed}},\quad\sum_{j\in\mathcal{A}_{\text{LLM}}}C^{u}_{j}(L_{j})\leq C,(4)
Lj≥0,j∈ALLM,\displaystyle L_{j}\geq 0,\quad j\in\mathcal{A}_{\text{LLM}},(5)
其中 Tfixed=∑i∈ANLLME[Ti]+∑j∈ALLM(τ ̄j+Xjλth) T_{\text{fixed}}=\sum_{i\in\mathcal{A}_{\text{NLLM}}}\mathbb{E}[T_{i}]+\sum_{j\in\mathcal{A}_{\text{LLM}}}\big(\bar{\tau}_{j}+\frac{X_{j}}{\lambda_{\text{th}}}\big) 表示不依赖于响应的延迟。由于对数函数是严格递增的,最大化 (3 (https://arxiv.org/html/2605.23929#S3.E3)) 中的乘积等价于最大化对数之和。我们有

maxLj,j∈ALLM\displaystyle\max_{L_{j},j\in\mathcal{A}_{\text{LLM}}}∑j∈ALLMlog⁡ρ^j(Lj)s.t.constraints (4 (https://arxiv.org/html/2605.23929#S3.E4)), (5 (https://arxiv.org/html/2605.23929#S3.E5))\displaystyle\sum_{j\in\mathcal{A}_{\text{LLM}}}\log\hat{\rho}_{j}(L_{j})

相似文章

低延迟系统中工具制作与自进化LLM代理

arXiv cs.CL

本文提出了一种方法,将重复的标准操作流程步骤编译为经过验证、有版本管理的工具,在部署前完成,替代推理时的代码生成。在一个配送中心的报警分类系统中,该方法将p50延迟降低了42%,端到端错误率降低了最多53%。

学习构建实用的智能体系统

arXiv cs.LG

本文提出了设计和优化实用智能体LLM系统的原则性方法,引入了一个包含伪工具和固定工作流的框架,以提高模块化、成本效益和跨多种任务的准确性。