从检索上下文到运行时控制:基于边缘RAG的自适应压缩
摘要
本文提出了一种针对基于边缘的RAG系统的遥测信息驱动的自适应压缩方案,实验表明中间压缩可以将GPU能耗降低高达53.2%,且质量损失可忽略不计。
查看缓存全文
缓存时间: 2026/08/21 09:57
# 从检索上下文到运行时控制:面向边缘RAG的自适应压缩 来源:https://arxiv.org/html/2608.19535 ## 从检索上下文到运行时控制:面向边缘RAG的自适应压缩 注:本文被录用为ACM AI Leadership Summit 2026会议论文集。 CCS:计算方法论 自然语言生成 CCS:信息系统 检索模型与排序 CCS:计算机系统组织 嵌入式系统 Zlatan Feric 注:两位作者对本研究贡献均等。 机构:美国马萨诸塞州波士顿,东北大学 邮箱:[[email protected]](mailto:[email protected]) Amir Taherin 机构:美国马萨诸塞州波士顿,东北大学 邮箱:[[email protected]](mailto:[email protected]) Yanzhi Wang 机构:美国马萨诸塞州波士顿,东北大学 邮箱:[[email protected]](mailto:[email protected]) 以及 David Kaeli 机构:美国马萨诸塞州波士顿,东北大学 邮箱:[[email protected]](mailto:[email protected]) © none ###### 摘要\. 检索增强生成(RAG)通过将生成过程锚定在外部文档段落中,提升了语言模型的回复质量,但这引入了开销:检索到的上下文延长了提示词长度,增加了预填充工作量、KV缓存占用、内存流量、延迟和能耗。上下文压缩通过裁剪检索到的文本为这一问题提供了自然的解决方案。然而,最先进的上下文压缩方法通常使用固定的压缩预算,或离线选择压缩率再在推理时应用。这种静态视角忽略了工作负载的变化以及边缘设备的实时状态。在边缘SoC上,压缩并非没有代价:压缩器本身在同一SoC上运行,会消耗可能抵消任何生成节省的延迟和能耗。 本文基于实验证据,提出了在边缘RAG中实施遥测信息驱动自适应压缩的愿景。我们在NVIDIA Jetson AGX Thor平台上,使用Llama和Qwen生成器、Natural Questions和HotpotQA数据集,以及LLMLingua-2压缩方法,对压缩权衡进行了表征。我们的测量表明,对于较大的模型,生成过程主导了RAG的开销,在7B-8B参数的生成器中,约占每次查询延迟的90%和GPU能耗的91%。探索压缩率的影响揭示了一个自适应工作区域:轻度压缩可能错过节能机会,而过于激进的压缩则可能损害推理质量。适度的压缩可以将GPU能耗降低高达53.2%,SoC能耗降低高达48.2%,同时质量损失可忽略不计。我们主张采用运行时策略动态管理压缩,由工作负载特征和边缘遥测数据指导。 ###### 关键词: 边缘RAG,上下文压缩,高效推理 ## 1\.引言 大语言模型(LLM)的能力和规模已迅速提升\(18 (https://arxiv.org/html/2608.19535#bib.bib34);2 (https://arxiv.org/html/2608.19535#bib.bib35);33 (https://arxiv.org/html/2608.19535#bib.bib36);48 (https://arxiv.org/html/2608.19535#bib.bib37);41 (https://arxiv.org/html/2608.19535#bib.bib52)\),但它们仍然受到幻觉\(12 (https://arxiv.org/html/2608.19535#bib.bib38)\)、过时的参数化知识\(19 (https://arxiv.org/html/2608.19535#bib.bib39)\)以及难以获取私有或领域特定信息\(7 (https://arxiv.org/html/2608.19535#bib.bib16);22 (https://arxiv.org/html/2608.19535#bib.bib14)\)等问题的困扰。检索增强生成(RAG)通过根据推理时检索到的段落来指导生成过程,解决了这些限制,使模型无需重新训练即可生成基于外部、动态和领域特定知识的回复\(22 (https://arxiv.org/html/2608.19535#bib.bib14)\)。这使得RAG成为那些要求准确性、新鲜度和可追溯性的领域中,构建实用LLM应用的理想基础。 在边缘运行RAG对于处理隐私敏感数据\(23 (https://arxiv.org/html/2608.19535#bib.bib25);39 (https://arxiv.org/html/2608.19535#bib.bib26)\)、延迟关键型应用(如机器人技术\(56 (https://arxiv.org/html/2608.19535#bib.bib40);21 (https://arxiv.org/html/2608.19535#bib.bib41);25 (https://arxiv.org/html/2608.19535#bib.bib53);45 (https://arxiv.org/html/2608.19535#bib.bib51)\)和增强现实\(5 (https://arxiv.org/html/2608.19535#bib.bib42);44 (https://arxiv.org/html/2608.19535#bib.bib55)\))、个人智能体\(37 (https://arxiv.org/html/2608.19535#bib.bib43);57 (https://arxiv.org/html/2608.19535#bib.bib44)\),以及云访问可能不可靠的移动和带宽受限场景具有很大吸引力。近期的边缘RAG系统通过诸如更快的向量搜索、紧凑索引和减少内存占用等优化,在受限平台上(包括移动设备\(42 (https://arxiv.org/html/2608.19535#bib.bib22);35 (https://arxiv.org/html/2608.19535#bib.bib23)\)、边缘SoC\(36 (https://arxiv.org/html/2608.19535#bib.bib24)\)和可穿戴系统\(43 (https://arxiv.org/html/2608.19535#bib.bib27)\))提升了效率。然而,这些系统主要关注检索/索引效率或固定的内容缩减策略。相反,我们应该探索如何根据应用内容在边缘设备上高效运行RAG。 这引出了以下问题:*一旦文档被检索到,在边缘设备上,应该将其中多少上下文传递给生成器?*RAG通过添加检索到的token来改善知识获取,但token在边缘硬件上开销昂贵。每个检索到的段落都会增加生成器所见的提示长度,从而增加预填充延迟、KV缓存占用、内存流量以及每次查询的能耗\(57 (https://arxiv.org/html/2608.19535#bib.bib44);42 (https://arxiv.org/html/2608.19535#bib.bib22)\)。这种成本在资源受限的边缘SoC上会被放大,因为其内存带宽、功率预算和散热空间都有限。此外,检索更多上下文并不保证能获得更好的答案:无关或冗余的段落可能会分散生成器的注意力,增加系统成本却无法提升回复质量\(15 (https://arxiv.org/html/2608.19535#bib.bib45);26 (https://arxiv.org/html/2608.19535#bib.bib46);55 (https://arxiv.org/html/2608.19535#bib.bib47);46 (https://arxiv.org/html/2608.19535#bib.bib54)\)。因此,边缘RAG带来了一组新的具有挑战性的权衡:*系统需要足够的上下文来保持答案质量,但又不能多到让生成过程过度消耗延迟和能耗。* 参见插图 图1\. 面向边缘RAG的遥测信息驱动自适应压缩。检索到的段落在生成前被压缩,但压缩率由控制器在运行时选择,该控制器观察边缘SoC遥测数据,并针对延迟、能耗、温度、内存和精度约束进行优化。*上下文压缩*是管理这种权衡的一个自然调节旋钮:它在生成前修剪或重写检索到的段落,旨在保留与查询相关的证据,同时减少输入token数。我们使用此术语是为了将其与更广泛的提示压缩工作区分开来\(24 (https://arxiv.org/html/2608.19535#bib.bib1)\):仅压缩检索到的上下文,而指令和少样本框架保持不变。与检索深度等更粗粒度的控制相比,压缩暴露了一个连续的速率旋钮:较低的速率更积极地减少生成负载,而较高的速率则保留更多证据。 然而,边缘上的压缩并非没有代价。压缩器与检索和生成在同一SoC上运行,会增加延迟、内存流量和能耗,同时与它们竞争共享资源。因此,相关的度量指标不是总体的生成加速比,而是*净收益*:缩短提示所带来的生成节省减去压缩器自身的开销。当上下文较短、生成器较小或移除的token过少时,静态压缩比可能导致净损失。 在本文中,我们提出了*遥测信息驱动自适应压缩*的愿景:上下文压缩应是一个运行时决策,而非固定的预处理步骤。如图1所示,边缘RAG系统可以利用工作负载特征和实时SoC遥测数据(例如延迟、能耗和内存带宽)来决定是否压缩以及使用何种压缩率。我们的目标是通过测量压缩何时有益、何时有害,以及哪些系统信号能揭示这一边界,来展示这种控制器的潜力。 为了评估这一潜力,我们在Jetson AGX Thor平台上测量了使用1B到8B参数的Llama和Qwen生成器、Natural Questions和HotpotQA数据集以及LLMLingua-2上下文压缩的RAG性能。我们的结果显示了三个发现。首先,对于7B-8B模型,生成过程主导了边缘RAG开销,约占每次查询延迟的90%、GPU能耗的91%和总SoC能耗的92%。其次,在考虑压缩器开销后,压缩可以带来显著的净节省,但其收益取决于模型大小、检索深度和数据集。第三,扫描压缩率揭示了一个自适应工作区域:轻度压缩可能损失能耗,过于激进的压缩可能损害答案质量,而中等压缩率则可以大幅降低能耗(例如,GPU能耗降低高达53.2%,SoC能耗降低高达48.2%),同时对质量影响甚微。 本文贡献如下:(1)对Jetson AGX Thor上边缘RAG的延迟和能耗进行阶段级表征,确定生成过程成为主导成本的时机;(2)对上下文压缩进行包含压缩器开销(而非仅报告生成加速)的净收益分析;(3)基于测量到的依赖于工作负载的权衡,为未来的边缘RAG系统提出遥测信息驱动自适应压缩的愿景。 ## 2\.背景与动机 ### 2\.1\.RAG流程与上下文成本 RAG流程包含两个阶段:离线索引阶段和在线查询阶段。离线时,文档集合被分割成段落并存储在可搜索的数据存储中,通常带有词法或向量索引以实现高效检索\(40 (https://arxiv.org/html/2608.19535#bib.bib13);17 (https://arxiv.org/html/2608.19535#bib.bib12)\)。在线时,用户查询被编码并用于检索排名靠前的段落;生成器LLM随后基于查询和检索到的上下文生成最终回复\(22 (https://arxiv.org/html/2608.19535#bib.bib14);11 (https://arxiv.org/html/2608.19535#bib.bib15)\)。现代RAG系统在此基本的“检索-然后-生成”流程中加入了额外的阶段,如查询重写\(28 (https://arxiv.org/html/2608.19535#bib.bib18);49 (https://arxiv.org/html/2608.19535#bib.bib19)\)、重排序\(30 (https://arxiv.org/html/2608.19535#bib.bib20);31 (https://arxiv.org/html/2608.19535#bib.bib21)\)和上下文压缩\(13 (https://arxiv.org/html/2608.19535#bib.bib2);24 (https://arxiv.org/html/2608.19535#bib.bib1)\),这些阶段插入在检索和生成之间\(7 (https://arxiv.org/html/2608.19535#bib.bib16);10 (https://arxiv.org/html/2608.19535#bib.bib17)\)。 同样,提升回答依据的检索上下文也带来了主要的系统成本:每个额外的段落都会增加生成器所见的提示长度。更长的提示会增加预填充工作量、KV缓存占用和内存流量,以及每次查询的能耗,在内存带宽、功率和散热空间有限的边缘SoC上尤其昂贵\(57 (https://arxiv.org/html/2608.19535#bib.bib44);42 (https://arxiv.org/html/2608.19535#bib.bib22)\)。*上下文压缩*被插入在检索和生成之间,以在生成器运行前降低这一成本。在本文中,我们使用术语*比率*表示*保留*的检索上下文token的比例,与LLMLingua-2所暴露的参数一致\(34 (https://arxiv.org/html/2608.19535#bib.bib4)\)。因此,率=0.5表示保留约一半的检索上下文,或在因子表示中约2倍压缩。压缩仅应用于检索到的上下文;系统提示、指令和少样本框架(系统消息、少样本示例)保持不变。 ### 2\.2\.上下文压缩方法 提示压缩方法通常分为*硬*压缩和*软*压缩\(24 (https://arxiv.org/html/2608.19535#bib.bib1)\)。硬压缩直接在推理前编辑文本输入,通过提取重要token或句子,或对输入进行摘要来实现\(13 (https://arxiv.org/html/2608.19535#bib.bib2);34 (https://arxiv.org/html/2608.19535#bib.bib4)\)。软压缩则将文本映射到解码器使用的潜在token或嵌入向量\(29 (https://arxiv.org/html/2608.19535#bib.bib6);8 (https://arxiv.org/html/2608.19535#bib.bib7);3 (https://arxiv.org/html/2608.19535#bib.bib8)\)。我们专注于硬压缩,因为它可以插入现有的RAG流程而无需更改生成器接口,并且压缩后的文本长度直接影响生成成本。 硬压缩可以是*抽取式*的或*生成式*的。抽取式方法在保留原始文本的同时,移除低重要性token或句子,如LLMLingua系列\(13 (https://arxiv.org/html/2608.19535#bib.bib2);34 (https://arxiv.org/html/2608.19535#bib.bib4);14 (https://arxiv.org/html/2608.19535#bib.bib5)\)。生成式方法如RECOMP会生成检索段落的新摘要\(51 (https://arxiv.org/html/2608.19535#bib.bib9)\),但这通常增加了一个自回归阶段,因此带来额外的延迟和能耗。先前的面向设备的研究表明,不同方法的压缩器成本差异很大\(52 (https://arxiv.org/html/2608.19535#bib.bib10);27 (https://arxiv.org/html/2608.19535#bib.bib11)\),使得开销成为边缘设备上的首要考量。Provence同样证明了在生成前过滤上下文的价值,但未暴露我们自适应控制研究所需的连续速率旋钮\(4 (https://arxiv.org/html/2608.19535#bib.bib3)\)。 我们使用LLMLingua-2\(34 (https://arxiv.org/html/2608.19535#bib.bib4)\)作为代表性压缩器,因为它是抽取式的、相对于生成器而言轻量级的,并且暴露了一个连续的*比率*参数。这使我们能够扫描比率,以测量生成节省、压缩器开销和答案质量之间的权衡。我们的目标不是声称LLMLingua-2是最终的边缘RAG压缩器,而是将其用作一个可控的代表,以识别压缩何时有益、何时造成净损失,以及自适应策略在何处有操作空间。 ### 2\.3\.边缘RAG与缺失的运行时视角 高效的边缘推理主要集中在通过量化、内存缩减、KV缓存优化和运行时调度来降低生成器成本。RAG扩展了这个问题:检索、可选的重排序或压缩以及生成都共享相同的延迟、内存、功率和散热预算。因此,像上下文压缩这样的阶段必须通过其*净*效应来评估,而不仅仅是生成加速。 最近的边缘RAG系统解决了该流程中的重要环节。EdgeRAG通过索引和嵌入技术优化了检索的内存和延迟\(42 (https://arxiv.org/html/2608.19535#bib.bib22)\);MobileRAG在移动设备上使用选择性内容缩减\(35 (https://arxiv.org/html/2608.19535#bib.bib23)\);RoCR利用边缘计算内存架构加速检索\(36 (https://arxiv.org/html/2608.19535#bib.bib24)\);可穿戴RAG系统优化了检索的能耗和内存移动\(43 (https://arxiv.org/html/2608.19535#bib.bib27)\)。这些先前的工作表明RAG可以在受限平台上运行,但它们主要针对检索/索引效率、平台
相似文章
RAGOCR:基于视觉表示的检索增强文本光学压缩
RAGOCR 是一种新颖框架,根据输入查询将检索到的文档压缩为紧凑的视觉表示,并利用查询感知的动态分辨率来平衡压缩率与信息保真度。实验表明,其在仅使用八分之一输入 token 的情况下,准确率比朴素 RAG 高出 15% 以上。
移动NPU上的能效型端侧RAG:Snapdragon X Elite系统设计与基准测试
本文介绍了首个完全运行在移动NPU(Snapdragon X Elite上的Qualcomm Hexagon)上的端到端RAG流水线,相比CPU实现了高达18倍的LLM预填充加速和4倍的能耗降低,且无质量退化。
CoinRAG: Contextualized Information Nugget KV Cache Reuse for Long-Context RAG
CoinRAG is a new method for long-context RAG that reuses fine-grained contextualized information nugget KV caches instead of full chunks, improving efficiency and answering quality. It achieves a new Pareto frontier with 5.3% relative F1 improvement on LongBench multi-hop QA tasks.
边缘设备上多模态联邦学习的熵引导张量压缩
论文介绍了MESH-FL,一种用于边缘设备上多模态联邦学习的熵引导矩阵乘积态压缩框架。它自适应地分配每层和每种模态的压缩秩,在异构树莓派集群上实现了高达56.8倍的压缩,并在最终准确率上比未压缩的FedAvg提升了2.01%。
Toward Reliable Context Compression for Long-Horizon Agents: An Empirical Study of Execution Instability
This empirical study investigates how recurrent context compression affects long-horizon agent behavior, showing that compression can weaken recent interaction influence and cause instability. The authors introduce TRACE, a verifier-guided framework that improves compression reliability and performance on AppWorld.