效率前沿:LLM上下文管理中成本-性能优化的统一框架
摘要
介绍效率前沿,一个用于优化LLM上下文管理中的成本和性能的统一框架,在HotpotQA上以可比较的性能实现了有效token使用量减少约25%。
arXiv:2605.23071v1 公告类型:新
摘要:大型语言模型(LLMs)越来越依赖长上下文处理,但扩展上下文窗口会带来巨大的计算和资金成本。现有的上下文缩减方法,包括检索和内存压缩方法,通常使用性能和效率指标独立评估,限制了系统比较和部署感知决策。
本文介绍了效率前沿(The Efficiency Frontier),一个用于LLM上下文管理中成本-性能优化的统一框架。该框架将上下文策略选择建模为一个部署感知的优化问题,通过摊销成本模型联合考虑任务性能、token成本和预处理重用。与现有孤立比较方法的评估不同,所提出的框架支持面向决策的分析,了解在不同操作条件下何时不同的上下文管理策略变得更可取。在5,000个HotpotQA实例上的评估显示,该框架揭示了基于检索和基于预处理的策略之间的不同操作区域和转换边界。结果表明,部署感知优化在可比较性能($F1 \approx 0.78$)下将有效token使用量减少约25%,而在更高性能设置中,摊销内存压缩相对于全上下文的提示实现了超过50%的token成本降低。总体而言,该框架为评估和部署可扩展、高效且可持续的LLM系统提供了原则性且实用的基础。
查看缓存全文
缓存时间: 2026/05/25 08:58
# 效率前沿:LLM上下文管理中的成本-性能优化统一框架 来源:https://arxiv.org/html/2605.23071 BINQI SHEN1†∗, LIER JIN2†, HANYU CAI1, LAN HU3, YUTING XIN4 1西北大学(Northwestern University)2杜克大学(Duke University)3卡内基梅隆大学(Carnegie Mellon University)4明尼苏达大学(University of Minnesota)电子邮箱:[email protected] [email protected] [email protected] [email protected] [email protected] †同等贡献∗通讯作者 ###### 摘要 大型语言模型(LLMs)日益依赖长上下文处理,但扩展上下文窗口会带来巨大的计算和财务成本。现有的上下文缩减方法(包括检索和记忆压缩方法)通常采用独立评估性能和效率指标的方式,限制了系统比较和部署感知决策。 本文引入了The Efficiency Frontier,这是一个用于LLM上下文管理中成本-性能优化的统一框架。该框架将上下文策略选择建模为一个部署感知优化问题,通过摊销成本建模共同考虑任务性能、令牌成本和预处理重用。与现有单独比较方法的评估不同,所提出的框架能够在不同操作条件下进行面向决策的分析,判断何时不同上下文管理策略更可取。在5,000个HotpotQA实例上进行的评估表明,该框架揭示了基于检索和基于预处理策略之间的不同操作区域和转换边界。结果显示,部署感知优化在可比性能(F1≈0.78)下将有效令牌使用量减少了约25%,而在更高性能设置中,摊销记忆压缩相比全上下文提示实现了超过50%的令牌成本降低。总体而言,所提出的框架为评估和部署可扩展、高效且可持续的LLM系统提供了原则性和实践性的基础。 ## 一、引言 近年来,大型语言模型(LLMs)取得了快速进展,在搜索、客户支持和知识工作等一系列自然语言处理任务中展现了强大的能力[1 (https://arxiv.org/html/2605.23071#bib.bib1)]。然而,这些进展伴随着不断增长的计算和财务成本,这既源于模型规模的扩大,也源于输入上下文长度的增加[2 (https://arxiv.org/html/2605.23071#bib.bib2)]。随着上下文窗口持续扩大,处理额外令牌的计算成本往往比下游任务性能的相应提升增长得更快,这使得高效利用上下文成为一个日益重要的挑战[3 (https://arxiv.org/html/2605.23071#bib.bib3)]。与此同时,大规模AI系统对环境的影响(包括能源和水消耗)引发了人们对其长期可持续性的担忧[4 (https://arxiv.org/html/2605.23071#bib.bib4),5 (https://arxiv.org/html/2605.23071#bib.bib5)]。这些挑战凸显了在LLM系统中更高效利用上下文的必要性。 近期的研究探索了多种在保持任务性能的同时缩减上下文长度的技术,包括基于检索的过滤、摘要和上下文压缩方法[6 (https://arxiv.org/html/2605.23071#bib.bib6),7 (https://arxiv.org/html/2605.23071#bib.bib7)]。这些方法旨在通过选择性保留最相关信息,同时丢弃冗余或信息量较少的内容来提高效率[8 (https://arxiv.org/html/2605.23071#bib.bib8)]。尽管这些方法展示了有希望的结果,但其评估仍然分散。现有研究通常报告如精确匹配(EM)或F1分数等性能指标,同时伴随令牌使用量或延迟等成本指标[9 (https://arxiv.org/html/2605.23071#bib.bib9)]。然而,这些指标往往被独立考虑,很少提供成本降低与性能退化之间权衡的统一评估[10 (https://arxiv.org/html/2605.23071#bib.bib10)]。此外,检索、压缩和长上下文方法常常在不同的实验设置下进行评估,使得直接比较变得困难。因此,目前仍难以系统比较不同的上下文缩减策略,或评估在实际部署约束下何时应偏好某一策略而非另一策略[11 (https://arxiv.org/html/2605.23071#bib.bib11)]。 为解决这一局限性,我们提出一个统一的评估框架,用于系统评估大型语言模型中上下文缩减技术的效率。我们引入了效率前沿(Efficiency Frontier)的概念,这是一个三阶段评估框架,用于表征不同上下文管理策略下任务性能与计算成本之间的权衡。与现有将性能和成本独立评估的方法不同,我们的框架提供了明确的决策逻辑来选择上下文管理策略,弥合了基于检索的方法与长上下文处理之间的差距。该框架引入了一个参数化的对数效用指标,以建模额外上下文带来的递减收益,同时考虑摊销的预处理成本。通过变化重用参数\(NN\),该框架能够在现实部署约束下进行系统比较,识别不同策略变优的交叉区域。 除了评估,该框架还为在不同成本和重用条件下选择上下文管理策略提供了研究和实践方面的实用指导,将关注点从最大化上下文容量转向优化真实LLM系统中的上下文利用率。为说明所提出的框架,我们在HotpotQA数据集上进行了实验[12 (https://arxiv.org/html/2605.23071#bib.bib12)],该数据集具有多跳推理特点,同时包含相关和干扰上下文,从而能够对上下文缩减及其对模型准确性的影响进行统一评估。 ## 二、相关工作 ### II-A 大型语言模型的评估 近年来,大型语言模型的评估框架已从单纯的任务准确性扩展到包含鲁棒性、公平性、泛化能力、计算效率以及对提示条件和交互风格的敏感性等更多维度。除了任务性能外,像HELM和近期专门基准测试这样的框架越来越强调模型行为的多维度评估,特别是准确性与执行效率之间的权衡[9 (https://arxiv.org/html/2605.23071#bib.bib9),13 (https://arxiv.org/html/2605.23071#bib.bib13)]。同时,高效和可持续人工智能方面的工作强调了资源感知评估标准的重要性,包括计算成本、能耗和延迟[14 (https://arxiv.org/html/2605.23071#bib.bib14)]。例如,绿色AI倡导将效率和资源使用纳入模型评估,因为模型规模和部署成本持续增长[15 (https://arxiv.org/html/2605.23071#bib.bib15)]。除了通用行为和资源使用,近期工作还认识到需要评估对齐系统的适用性,定义为其在真实扰动下的可靠性[16 (https://arxiv.org/html/2605.23071#bib.bib16)]。这一转变凸显了从静态基准测试转向可在部署条件下经得起验证的评估框架的必要性。 然而,现有方法通常将任务有效性、计算成本和部署效率视为独立变量。这种碎片化掩盖了实际部署中的权衡,因为从业者必须在没有标准化评估标准的情况下平衡任务性能和计算成本[17 (https://arxiv.org/html/2605.23071#bib.bib17),18 (https://arxiv.org/html/2605.23071#bib.bib18)]。许多研究报告了如F1或压缩比等性能指标以及基本成本指标,但很少提供部署感知的、端到端的按查询令牌或货币成本与任务性能之间的比较,涉及不同的上下文管理策略。这一局限性在长上下文设置中尤为突出,因为上下文长度的增加可能使计算成本大幅上升,而不一定带来下游性能的持续提升。近期关于长上下文评估的研究表明,增加上下文或模型复杂度并不一定能带来成比例的性能提升[19 (https://arxiv.org/html/2605.23071#bib.bib19)]。 ### II-B 上下文长度缩放与递减收益 随着长上下文能力的持续扩展,大型语言模型(LLMs)的最新进展显著增加了最大上下文长度,使模型能够处理更长的序列,并将更多信息融入其推理过程。虽然更长的上下文窗口可以提升需要多跳推理或长距离依赖的任务性能,但经验证据表明,这些收益往往受到递减收益的限制[20 (https://arxiv.org/html/2605.23071#bib.bib20)]。 研究表明,LLM并不总能有效利用长输入序列。“迷失在中间”现象表明,模型往往未能充分利用位于长序列中间部分的信息[19 (https://arxiv.org/html/2605.23071#bib.bib19)],而更近期的研究报告了由于注意力稀释和干扰物干扰导致的性能下降,因为上下文长度增加[21 (https://arxiv.org/html/2605.23071#bib.bib21),22 (https://arxiv.org/html/2605.23071#bib.bib22)]。大规模评估进一步显示,模型常常未能充分利用可用的额外上下文[23 (https://arxiv.org/html/2605.23071#bib.bib23)]。 与此同时,由于注意力机制的二次复杂度,长上下文处理的计算成本随着序列长度不成比例地增长[24 (https://arxiv.org/html/2605.23071#bib.bib24)],而性能提升往往是次线性或不一致的[19 (https://arxiv.org/html/2605.23071#bib.bib19),25 (https://arxiv.org/html/2605.23071#bib.bib25),26 (https://arxiv.org/html/2605.23071#bib.bib26)]。这些局限性激发了人们对缩减或选择性处理上下文方法的日益增长的兴趣,以期在保持任务性能的同时提高效率。然而,现有工作主要集中在提升长上下文能力或进行性能基准测试,而非系统建模上下文长度、计算成本和下游性能之间的权衡。 ### II-C 上下文缩减技术 为缓解与长上下文处理相关的高昂计算成本,越来越多的研究探索了在保持任务性能的同时缩减上下文长度的技术。近期工作提出了各种上下文压缩技术,包括令牌级压缩策略和指令驱动的路由机制,这些机制选择性稀疏化输入令牌以减少推理延迟[27 (https://arxiv.org/html/2605.23071#bib.bib27),28 (https://arxiv.org/html/2605.23071#bib.bib28)]。其他研究探索了推理增强型适应、指令微调以及多模态融合策略,用于在复杂的LLM设置中改善上下文理解和高效上下文利用[29 (https://arxiv.org/html/2605.23071#bib.bib29),30 (https://arxiv.org/html/2605.23071#bib.bib30),31 (https://arxiv.org/html/2605.23071#bib.bib31)]。此类策略越来越多地被用于实现时间受限应用的实时部署[32 (https://arxiv.org/html/2605.23071#bib.bib32)]。此外,语义稀疏化和过滤技术等上下文缩减方法旨在生成前移除冗余上下文,提高效率、鲁棒性和风险感知韧性[33 (https://arxiv.org/html/2605.23071#bib.bib33),34 (https://arxiv.org/html/2605.23071#bib.bib34),35 (https://arxiv.org/html/2605.23071#bib.bib35)]。在这些想法的基础上,混合检索和路由方法也被提出,以进一步提高鲁棒性和上下文选择能力[36 (https://arxiv.org/html/2605.23071#bib.bib36)]。 现有工作主要单独评估检索、压缩和长上下文处理,且比较往往在不同数据集、提示设置或成本假设下进行。因此,很难确定在可比条件下何时某一策略比另一策略更高效或更有效。这种缺乏标准化评估的情况使得系统推理不同上下文管理策略之间的效率-性能权衡变得困难,从而激发了对统一评估框架的需求。 ## 三、方法 我们提出了一个结构化的三阶段框架,用于系统评估大型语言模型上下文管理策略中性能与计算成本之间的权衡。与先前的单独优化准确性或效率的方法不同,我们的框架显式建模了部署约束下的决策,使得策略选择能够根据性能要求和系统使用模式进行调整。 一个核心贡献在于区分了内在成本(每次查询的推理成本)和摊销成本(包括可重用的预处理),通过重用参数\(NN\)进行捕捉。这种表述反映了现实部署场景,例如共享记忆系统、缓存摘要和多查询工作负载,在这些情况下,前期计算可以在多个查询之间重用。因此,该框架支持在统一目标下跨异构操作区域进行评估。 ### III-A 效率前沿框架 我们将上下文管理表述为一个决策问题:给定对性能和成本的部署偏好,选择最大化效用的策略和配置。 #### III-A1 成本模型 我们将计算建模为两阶段过程。令\(T_{\text{stage1}}\)表示上下文预处理成本(例如记忆压缩),\(T_{\text{stage2}}\)表示每次查询的推理成本。当上下文预处理在\(N\)个查询中被重用时,有效成本为: \[\text{EffectiveTokens}=T_{\text{stage2}}+\frac{T_{\text{stage1}}}{N}\quad(1)\] 这区分了内在成本(每次查询推理)和上下文重用下的摊销成本。 #### III-A2 效率分数 我们定义了一个参数化效用函数,以捕捉性能与成本之间的权衡: \[\text{EfficiencyScore}(w)=w\cdot F1-(1-w)\cdot\log(\text{EffectiveTokens})\quad(2)\] 其中\(w\in[0,1]\)控制性能与效率之间的偏好。较大的\(w\)强调准确性,而较小的\(w\)则优先考虑较低的成本。 这一表述捕捉了两个关键特性:(i) 通过\(N\)在重用条件下摊销预处理成本,以及(ii) 通过对数惩罚对令牌成本的递减敏感性,反映了实际操作中对成本增长一定程度的容忍。 #### III-A3 优化步骤 效率前沿通过三个阶段构建: - •阶段1:策略内优化。对于每种策略,评估一系列配置(例如压缩比、检索深度),并仅保留那些在给定偏好下最优的配置。
相似文章
@omarsar0: // The Efficiency Frontier // 关于上下文管理的有趣论文。随着代理在多次交互中重复使用相同的文档和历史记录……
本文介绍了The Efficiency Frontier,一个用于LLM上下文管理成本-性能优化的统一框架,它将上下文策略选择建模为一个部署感知的优化问题,通过摊销内存压缩,与全上下文提示相比,实现了25%的token使用量减少和超过50%的token成本降低。
我对LLM代码风格与Token成本的发现
本文讨论了LLM代码风格选择如何影响Token消耗和成本,并提供了优化建议,如使用Web API标准和更简单的缩进以减少输出Token。
推理的影子价格:LLM最优预算分配的经济学视角
本文将LLM推理预算分配形式化为一个约束优化问题,提出CLEAR方法,将资源从低效用查询重新分配到接近涌现阈值的查询,在预算紧张的情况下实现了高达3倍的准确率提升。
我们在询问 AI 的用途之前,就先优化了 LLM 成本
一位 AI 顾问反思了团队如何在不质疑任务是否需要模型的情况下优化 LLM 成本,并主张衡量每次成功结果的成本,而不是每 token 的成本。
面向LLM赋能代理工作流的可靠设计:优化延迟-可靠性-成本权衡
本文分析了LLM赋能代理工作流中延迟、可靠性和成本之间的权衡,引入了性能模型,并推导出了如注水令牌分配等最优资源分配策略。