大型语言模型推理网络的最优模型激活策略

arXiv cs.CL 论文

摘要

本文介绍了推理网络,一个基于图的框架,用于优化多个LLMs在推理中的使用,具有最优激活策略,可在满足性能目标的同时最小化成本。

arXiv:2609.15992v1 Announce Type: new 摘要:大型语言模型(LLMs)的最新进展使其成为自然语言处理(NLP)任务的必要工具,其高推理成本促使了对成本-性能权衡的研究。在实践中,多个专家LLMs被协同用于推理,无论是集成模式还是串联模式,但缺乏一种原则性的方法来最佳使用可用模型。自适应方法可以将简单查询路由到较便宜的LLMs,将复杂查询路由到更强大、更昂贵的模型。然而,如何最好地利用可用的专家模型尚不明确。我们引入了推理网络,一个基于图的框架,其中节点表示不同的LLMs,链接表示条件模型激活。推理网络设计问题是要确定最佳拓扑结构,即使用模型的最佳方式,以最佳方式解决成本-性能权衡问题。我们从一系列LLM专家的基本拓扑结构开始,每个专家具有不同的成本和不同的专业知识水平,这通过模型置信度来捕获。我们将这些模型的最优激活问题形式化,以在满足目标性能约束的前提下最小化期望推理成本。对于这种特殊类型的推理网络,我们证明最优激活策略具有阈值结构:首先查询成本最低的LLMs,仅当置信度低于定义的阈值时才调用更昂贵的LLM。对于判别性任务,最优策略由一组阈值组成,每个类一个阈值;而对于生成性任务,它由单个阈值组成。我们提供了计算阈值的结构化方法,以及针对两种任务类型的实用置信度估计机制。使用开源LLMs的实验显示,在满足指定性能预算的同时,成本显著降低。
查看原文
查看缓存全文

缓存时间: 2026/09/16 08:35

# 大语言模型推理网络的最优模型激活策略  
来源:https://arxiv.org/html/2609.15992  

Md Ibrahim Ibne Alam  
耶鲁大学电气与计算机工程系  
Iordanis Koutsopoulos  
雅典经济与商业大学信息学系  
Koushik Kar  
伦斯勒理工学院电气、计算机与系统工程系  

###### 摘要  
近期大语言模型(LLMs)的进展使其成为自然语言处理(NLP)任务的必需工具,而其高昂的推理成本促使研究者关注任务执行中的成本-性能权衡。实践中,多个专家LLM常以协同方式用于推理(无论是集成模式还是串行模式),但目前缺乏系统化的方法来指导如何最优利用现有模型。自适应方法可以将简单查询路由给成本较低、可靠性稍差的LLM,而将复杂查询交由能力更强、成本更高的模型处理。然而,由于该策略聚焦于查询难度而非模型专长,我们仍缺乏对如何充分利用现有专家模型的清晰认知。本文引入并奠定了“推理网络”的基础框架,这是一个基于图结构的模型,其中节点代表可选的LLM,边表示条件性模型激活。推理网络设计问题在于确定最优拓扑结构,即如何最好地使用(部分或全部)模型以解决成本-性能权衡问题。  

我们从LLM专家串行连接的基础拓扑出发,每个模型具有不同的成本和专业水平(通过模型置信度表征)。我们构建了在目标性能约束下最小化预期推理成本的模型最优激活问题模型。针对这类特殊推理网络,我们证明了最优激活策略具有阈值结构:首先查询成本最低的LLM,仅当置信度低于特定阈值时才调用更昂贵的模型。对于判别式任务(如分类),最优策略包含一组阈值(每个类别一个阈值);而对于生成式任务(如问答),则仅需单一阈值。我们提供了计算阈值的结构化方法(包括低维搜索或适用时的解析解),并为两类任务设计了实用的置信度估计机制。使用开源LLM在文本分类和生成基准上的实验表明,在满足性能预算的前提下可实现显著的成本降低。  

## 1 引言  
生成式语言建模的最新进展,特别是基于Transformer的自回归大语言模型(LLMs),显著提升了复杂自然语言处理任务的性能。这些基础模型的卓越能力(常为零样本)使从业者和研究者越来越依赖它们构建应用。然而,鉴于训练和使用此类模型(通常包含数百亿参数)所需的高计算负担,人们常面临选择哪种LLM服务的决策——需考虑可用预算、质量期望及显著成本(可能涵盖经济成本、计算成本或能耗)。因此,这种需求催生了多种不同目标的方法。模型压缩与剪枝技术(如[12,13])旨在降低使用大型模型的成本,而模型集成方法(如[10,11])则利用多个模型的表达能力(但成本更高)。还有些中间方法试图选择最适合的模型,同时缓解计算需求。例如自回归解码机制的替代方案(如[14]),其大部分生成的词元使用低成本LLM,仅在必要时切换至昂贵模型(例如当廉价模型的估计置信度不足或与目标分布偏差较大时)。  

另一种在平衡成本与输出质量方面极具潜力的方法是自适应推理,它根据任务复杂度动态调整计算资源投入。通过选择性切换不同模型,自适应推理方法能显著降低推理成本(如计算FLOPs或API费用),同时不过度损害结果准确性。本工作超越了仅依赖查询特征的LLM推理方案,引入并研究了“推理网络”——一种优先考虑模型专长并为各类NLP任务提供理论模型激活依据的LLM专家框架。我们将推理网络定义为有向图,其中节点代表可用LLM,当基于已执行模型i的结果激活模型j时,存在有向边(i,j)。推理网络设计问题指寻找最优拓扑结构的问题,即如何最好地使用(部分或全部)模型以解决成本-性能权衡。此类推理网络的特例包括集成拓扑(并行节点)——使用可用模型并聚合输出,以及链式拓扑(串行节点)。本文专注于推理网络的一个简单但基础的情形:串行模型。对于两个LLM,首先激活成本较低的模型,其输出置信度决定是否需调用更昂贵模型,从而将路由决策建立在模型专长基础上。  

该系统的关键组件是将输入查询转交给更大模型的规则(即模型激活规则)。为执行生成式任务的LLM设计此类规则并非易事,且会带来挑战[15]。先前工作如FrugalGPT[16]或Hybrid LLM[17]仅提供经验性策略,通过学习的辅助路由模型研究如何在不同LLM间分配查询。相反,我们专注于推导基于LLM自置信度的理论最优结构的激活策略,无需借助需额外训练和数据收集的外部路由模型。特别是在(温和)假设下,我们证明最优激活策略基于阈值:首先使用最低成本LLM,评估其响应的置信度,仅当该置信度低于特定阈值时才升级至更昂贵模型。对于分类等判别式任务,最优策略可表示为一组类别特定阈值。此外,我们通过实验在真实场景中展示了这些策略相对于其他最先进方法[16,17]的优越性,使用开源LLM在各类文本分类和文本生成数据集上实现了显著的成本降低(某些情况下高达97%),同时性能保持在预定预算约束内。这表明我们的策略可在实际场景中实现更优的成本-质量权衡。  

## 2 背景  
##### LLM推理。我们专注于回答自然语言查询。一系列实际的NLP生成或判别式任务(如问答或文本分类)可自然地表示为查询-答案元组。为生成输入查询的响应,我们依赖LLM(⋅): Q→A,该模型在给定查询q∈Q时产生答案â∈A。该领域的最新进展也涉及基于人类反馈的强化学习训练方法[18,19],在对话、代码生成、指令遵循和常识推理[20-27]等多种任务上提供了最先进成果。推理时,LLMs可将任何查询q作为文本生成任务处理。对于判别式任务,A可以是预定义类别集合A={ai}i∈[A],因此可限制模型仅输出与该集合相关的词元。对于需要显式文本生成的任务,可对整个词表的(预测)后验分布[28-30]进行采样以生成响应。  

##### 网络激活。除生成响应外,我们还需估计LLM对其输出的置信度。置信度估计旨在提供反映模型答案可靠性的分数,实际中计算此分数可能具有挑战性。该挑战可通过基于不确定性估计的自评估熵度量[31,15,32]或涉及外部评分模型的替代方法[16]来解决。本工作中,我们通过基于预测概率分布的简单函数评估模型的内部确定性,产生范围在[0,1]的置信度分数。任务类型(判别式或生成式)决定了函数定义:生成式任务需要为整个文本序列提供分数,而判别式任务仅需为预测类别提供分数。更复杂的置信度估计方法[33-35]留待未来研究。  

## 3 系统模型  
核心思想是通过串行模型网络执行LLM推理,每个模型依次应用且复杂度逐步提升(即参数更多、推理成本更高)。串行网络是一个有向图G=(V,E),其中V={1,…,N},E⊆V×V,使得对每条边(i,j)∈E,若模型i无法处理查询则激活模型j。我们考虑两种LLM:一个低成本模型(sLLM)成本为cs,一个高成本模型(mLLM)成本为cm>cs。假设查询q的真实答案为a∈A。sLLM和mLLM分别预测âs∈A和âm∈A。为路由查询,我们使用sLLM的置信度β∈[0,1]——β=β(q)是基于sLLM预测概率分布计算的得分。我们定义阈值θ∈[0,1],当β<θ时激活mLLM。对于第i个查询,其成本为:c(βi,θ)=cs+π(βi,θ)⋅cm=cs+1[βi<θ]⋅cm。因此期望成本仅取决于β低于阈值的频率:CostST(θ)=cs+cmEβ[1[β<θ]]=cs+cmPr(β<θ)=cs+cm∫0θf(β)dβ。  

相应地,我们可根据两种不同设置定义误差形式。第一种假设“教师-学生”范式,其中mLLM被视为专家模型(即“教师”),因此仅当β≥θ时sLLM才会产生误差。第二种设置允许两个模型都可能出错。具体而言,从Oracle设置开始(其中â=âm),基于查询的误差为:e(âim,âis,βi,θ)=(1−π(βi,θ))1[âim≠âis]=1[βi≥θ]1[âim≠âis],其中二元误差指标1[âim≠âis]可相应地为生成式任务定义(例如,当真实与预测答案嵌入的余弦相似度cos(emb(âim),emb(âis))低于阈值δ时,视为不匹配)。我们可计算期望误差(称为“ST-O”:单阈值Oracle)为:ErrorST-O(θ)=Ea,âim,âis,β[1[β≥θ]1[âm≠âs]]=∫01∑a,âim,âis1[β≥θ]1[âm≠âs]f(a,âm,âs,β)dβ=∫01∑âim,âis1[β≥θ]1[âm≠âs](∑af(a,âm,âs,β))dβ=∫01∑âim,âis1[β≥θ]1[âm≠âs]f(âm,âs,β)dβ。  

利用概率链式法则,可将联合分布分解为f(âm,âs,β)=f(β)⋅f(âm,âs|β),从而将式(5)写为:ErrorST-O(θ)=∫011[β≥θ]f(β)[∑âm,âis1[âm≠âs]f(âm,âs|β)]dβ。为简化表达式,可使用条件概率定义、指示函数期望(等于事件概率)和全期望公式(取Z=1[β≥θ]1[â≠â]),得到:ErrorST-O(θ)=∫θ1εs(β)f(β)dβ,其中εs(β)=∑âm,âs1[âm≠âs]f(âm,âs|β)是给定sLLM置信度为β时模型输出不同的条件概率。

相似文章

降低LLM延迟

Reddit r/AI_Agents

用于降低大语言模型延迟、提高推理速度的技术和方法。

基于超网络的大语言模型知识注入的缩放定律

Hugging Face Daily Papers

本文研究了基于超网络将知识注入大语言模型的缩放定律,发现了可预测的幂律缩放和可靠的分布外泛化,确立了超网络作为LoRA和全参数微调的可扩展替代方案。