LeanStream:一种用于高效设备端LLM推理的推测与精炼流式框架
摘要
LeanStream是一种流式推测与精炼框架,通过逐步优化计算和I/O操作,实现高效的设备端LLM推理,减少内存使用并提高吞吐量。
arXiv:2609.03079v1 公告类型:新
摘要:设备端LLM推理因其隐私性和响应速度而具有吸引力,但在移动和嵌入式设备上仍然具有挑战性,因为模型权重远超过可用的DRAM。先前的系统利用激活稀疏性并将权重卸载到SSD或闪存存储,但面临一个基本的系统权衡:准确的稀疏执行决策需要最新的上下文,而高效的计算-I/O重叠需要早期预测。因此,现有设计要么序列化执行,要么导致冗余的权重获取、额外的计算和巨大的缓存开销。我们提出LeanStream,一种用于高效设备端LLM推理的流式推测与精炼框架。LeanStream利用部分GPU结果逐步优化计算、加载和缓存保留优先级,实现GPU执行和存储I/O之间的细粒度重叠。我们在移动和嵌入式平台上实现了LeanStream。与先前的设备端LLM推理系统相比,在先前工作的最佳吞吐量下,LeanStream将内存使用减少了4.8$\times$到7.5$\times$,同时进一步将令牌生成吞吐量提高了1.6$\times$到2.1$\times$。
查看缓存全文
缓存时间: 2026/09/04 06:20
# LeanStream:一种用于高效设备端LLM推理的推测-优化流式框架 来源:https://arxiv.org/html/2609.03079 1乔治梅森大学 2摩根大通全球技术应用研究部 3堪萨斯大学 会议:第32届移动计算与网络国际年会;2026年10月26–30日;美国德克萨斯州奥斯汀 第32届移动计算与网络国际年会(MobiCom '26),2026年10月26–30日,美国德克萨斯州奥斯汀 DOI:10.1145/3795866.3844470 (https://doi.org/10.1145/3795866.3844470) ISBN:979-8-4007-2505-0/26/10 CCS:计算方法学 机器学习 CCS:软件及其工程 任元刘1,玉阳耿1,凯岩刘1,禹洲钟1,少涵胡2,春傅(理查德)陈2,培军赵2,鹤哲尹3,硕超姚1 通讯邮箱:[rliu23,yleng2,kliu23,[email protected], shaohan.hu,richard.cf.chen,[email protected]](mailto:rliu23,yleng2,kliu23,[email protected],%0Ashaohan.hu,richard.cf.chen,[email protected]%0A) 邮箱:[[email protected], [email protected]](mailto:[email protected],%[email protected]%0A) © cc ###### 摘要 设备端LLM推理因其隐私性和响应速度而备受关注,但在移动和嵌入式设备上仍然面临挑战,因为模型权重远超可用DRAM容量。现有系统利用激活稀疏性并将权重卸载至SSD或闪存存储,但面临一个根本的系统权衡:准确的稀疏执行决策需要最新上下文,而高效的计算-IO重叠则需要早期预测。因此,现有设计要么将执行串行化,要么导致冗余的权重获取、额外计算和巨大的缓存开销。我们提出了LeanStream,一种用于高效设备端LLM推理的推测-优化流式框架。LeanStream利用部分GPU结果逐步优化计算、加载和缓存保留优先级,实现GPU执行与存储IO之间的细粒度重叠。我们在移动和嵌入式平台上实现了LeanStream。与先前的设备端LLM推理系统相比,LeanStream在先前工作达到的最佳吞吐量下将内存使用量降低了4.8倍至7.5倍,同时将token生成吞吐量进一步提高了1.6倍至2.1倍。 ###### 关键词:移动计算,设备端推理 ††许可证:by ## 1. 引言 大型语言模型(LLMs)的兴起近期引起了广泛关注。日益增长的隐私与安全需求,加之日常个人计算设备的普及,创造了对设备端LLM推理的强烈需求。然而,由于移动平台的内存和计算能力有限,这仍然具有挑战性。为克服这一挑战,近期研究提出将模型权重存储在SSD或闪存中,并仅动态激活和执行相关的子模型(Alizadeh等人,2024;Song等人,2024;Xue等人,2024)。通过利用在广泛范围(如果不是全部)LLM中观察到的普遍激活稀疏性(Liu等人,2023;Liu等人,2025a;Federici等人,2025),这些方法可以动态识别活跃的权重子矩阵,将其从存储加载到设备内存,并仅按需计算必要部分。与加载和执行完整权重相比,利用动态激活稀疏性原则上可将内存和计算成本降低高达80%(Liu等人,2023;Liu等人,2025a;Federici等人,2025)。然而,在实践中实现这些理论增益在系统级优化方面造成了根本性张力。为了就加载和执行哪些权重块或子模型做出准确决策,预测器理想情况下依赖于最新上下文,即前一层的输出。然而,这种对完全更新上下文的依赖限制了IO预取和流水线等优化机会(Guo等人,2023;Wang等人,2025;Chen等人,2025;Chen等人,2026),导致显著的IO停滞。为缓解此瓶颈,许多系统采用逐层推测性IO获取(Liu等人,2023;Alizadeh等人,2024;Song等人,2024;Xue等人,2024),其中激活模式使用当前层完成前可用的输入进行预测。这使得权重传输可以与前一层的计算重叠,从而隐藏部分IO延迟。然而,由于此类推测未使用最新上下文,它通常产生不够准确的激活预测,导致系统加载不必要的权重子矩阵并执行超出所需的子模型。一些系统进一步通过引入内存权重缓存(Xue等人,2024;Alizadeh等人,2024)来缓解IO延迟。然而挑战依然类似:用于决定保留和执行哪些权重子矩阵的最具信息性的特征通常仍在当前计算内核中产生。在缺乏准确预测指导的情况下,这些设计可能导致显著的内存冗余(例如,对于7B LLM,缓存权重和预测模型约3GB)和显著的计算开销(例如,比理想激活模式所需的计算多出3倍以上)(Xue等人,2024;Alizadeh等人,2024)。 参考图1:设备端LLM推理中激活稀疏性面临的挑战。(a) 全上下文预测实现高准确性,但强制计算与IO串行化。(b) 逐层推测性获取将IO与计算重叠,但导致预测错误和冗余IO。(c) 带缓存的推测减少IO停滞,但仍引入内存冗余和额外计算。(d) 我们的推测-优化流式流水线逐步更新上下文,实现更细粒度的计算-IO协调。 因此,我们关键洞察是统一“等待最新上下文以生成最准确、高效的计算和IO决策”与“执行长期预测以优先处理未来计算和数据移动”两者。我们始终从基于可用最新信息的初始预测开始,然后以细粒度的流式方式持续优化计算优先级和数据加载/保留决策。具体而言,当GPU仍在处理前一层时,系统利用部分中间结果逐步优化推测性数据加载和执行优先级,持续更新IO请求以减少冗余。同时,IO子系统以细粒度块流式传输所需权重,使GPU一旦计算资源空闲即可开始执行最高优先级的可用子模型,而不是等待一层整个稀疏权重集到达。 然而,实现提议的流式框架提出了若干非平凡挑战。首先,推测-优化设计要求移动和嵌入式SoC上的异构处理器频繁协调,其中CPU处理激活稀疏性预测和IO,而GPU执行计算。现有同步机制(如全局屏障,例如CUDA中的`cudaDeviceSynchronize`或OpenCL中的`clFinish`)在高频使用时产生过高开销。基于事件的原语(如`cudaEvent`或`cl_event`)减少了此开销,但它们仅提供从协处理器到CPU主机的单向通知。此限制阻止了主机基于动态IO进度对GPU优先级执行施加实时双向控制。此外,由于这些原语在内核粒度上操作,它们通常需要手动内核分区,这进一步增加了内核启动开销和整体系统成本。更重要的是,尽管更细粒度的进程间通信可提高激活模式预测准确性并减少空闲时间,但过于频繁的协调牺牲了硬件并行性并引入了额外开销。因此,系统必须确定适当的协调频率。然而,此选择无法离线固定,因为IO延迟是非确定性的,并随运行时因素(如缓存未命中行为)而变化。结果,整个流式流水线的执行时间变得不可预测,使得自适应在线控制至关重要。 第二个挑战是如何高效利用GPU中间结果预测动态激活模式及其相对重要性。与先前在内核粒度上进行预测的方法不同,我们的方法以更高的协调频率运行,显著收紧了预测的延迟预算。如果此过程效率不足,预测延迟本身可能成为瓶颈,削弱频繁设备间协调的收益。这使得一个轻量级、高性能的预测模型对于系统控制至关重要,以便决策能够跟上高速的推测-优化流。 为解决这些根本瓶颈,我们提出了**LeanStream**,一种用于高效设备端LLM推理的推测-优化流式框架。LeanStream通过允许计算和数据移动决策逐步而非整体地制定,弥合了上下文感知预测与系统级效率之间的差距。LeanStream从使用最新可用上下文的初始预测开始,然后在中间结果产生时持续更新计算优先级和数据加载/保留决策。此设计实现了IO与GPU计算之间的细粒度重叠,从而减少了冗余数据移动,最小化了处理器空闲时间,并提高了资源受限的移动和嵌入式平台上的端到端推理效率。 **细粒度流式控制**。为支持高频信息交换,我们设计了一个轻量级通信和数据管理框架,以最小化GPU执行与CPU侧控制和IO之间的协调开销。该框架减少了同步开销和元数据流量,实现了细粒度流式处理而不会导致额外停滞。我们还严格分析了频繁协调引入的权衡,并设计了一个自适应在线控制器来管理它。通过在运行时动态调整同步频率,控制器在预测准确性和硬件并行性之间维持有效平衡,从而最大化端到端系统吞吐量。 **基于堆叠可学习哈希的轻量级系统控制**。我们设计了一种基于堆叠可学习哈希的轻量级控制机制,用于在细粒度流式执行下实现低延迟、内存高效的预测。与传统的浅层MLP控制器相比,堆叠可学习哈希以显著更低的运行时和内存开销提供了高表达能力。通过依赖高效的位操作、寄存器内表查找和紧凑的输出表示,它在保持强大建模能力的同时最小化了预测延迟。同时,它完全兼容标准监督学习,并可通过反向传播进行端到端训练。这使其成为高速推测-优化执行的有效控制原语。 参考图2:一次预测与LeanStream部分特征优化的依赖链。(a) 现有逐层预测器使用进入$\mathrm{MLP}_n$的残差状态对$\mathrm{MLP}_{n+1}$的神经元优先级进行固定的单次预测。(b) LeanStream按优先级顺序分阶段执行$\mathrm{MLP}_n$。每个阶段完成后,其输出与残差状态累加,形成越来越完整的部分残差特征,用于优化$\mathrm{MLP}_{n+1}$的神经元优先级。 我们在三个LLM上评估了LeanStream:Mistral-7B(Jiang等人,2023)、Llama2-7B(Touvron等人,2023)和Qwen2.5-7B(Yang等人,2025),横跨两个嵌入式平台(NVIDIA Jetson AGX Orin和Jetson AGX Xavier)和一个移动平台(OnePlus 13)。与最先进的LLM推理系统(Xue等人,2024;Alizadeh等人,2024;Liu等人,2023)相比,LeanStream在先前工作达到的最佳吞吐量下将内存使用量降低了4.8倍至7.5倍,并将token生成吞吐量进一步提高了1.6倍至2.1倍。 总而言之,本文做出以下贡献: - •我们提出了**LeanStream**,一种用于高效设备端LLM推理的推测-优化流式框架。 - •我们引入了**细粒度流式控制**设计,通过自适应在线协调CPU、GPU和IO来减少停滞,同时保持硬件并行性。 - •我们提出了**堆叠可学习哈希**,一种在严格延迟和内存预算下实现快速系统控制的轻量级预测机制。 - •我们在移动和嵌入式平台上实现并评估了LeanStream,显示出相比先前方法在资源利用率和推理效率方面的显著提升。 ## 2. 动机与相关工作 ### 2.1 设备端LLM推理的挑战 在边缘和移动设备上部署LLMs根本上受限于模型大小与可用DRAM之间的差距。实际上,由于操作系统和活跃应用程序已占用设备内存的大部分,此约束更为严峻。先前工作探索了各种技术来提高移动设备上学习系统的效率和可部署性(Yao等人,2017;Yao等人,2018;Liu等人,2024b;Liu等人,2025b;Liu等人,2025c;Leng等人,2023;Leng等人,2026)。为解决模型权重超出可用DRAM的更直接挑战,常见方法是将模型权重置于SSD上并按需获取(Alizadeh等人,2024;Liu等人,2023)。
相似文章
ProactiveLLM: 学习主动交互的流式大语言模型
ProactiveLLM 提出了一种方法,使流式大语言模型能够基于内源性线索主动决定何时生成输出,通过基于掩码的流式建模和同步特权自蒸馏,在无需外部标注的情况下降低延迟。
多流大语言模型:通过并行思维、输入与输出流解锁语言模型的潜力
本文提出了多流大语言模型(Multi-Stream LLMs),将基于顺序消息的指令微调转变为并行流处理。这种方法允许语言模型在多个并发数据流中同时进行读取、思考和生成,解决了自主智能体应用中的瓶颈问题。
利用移动NPU的高效端侧扩散大语言模型推理
本文提出了llada.cpp,一种NPU感知推理框架,用于在智能手机上加速扩散大语言模型(dLLM)。它引入了三种技术——Multi-Block Speculative Decoding、Dual-Path Progressive Revision和Swap-Optimized Memory Runtime——以使dLLM推理与移动NPU特性对齐,实现了相比CPU基线17-42倍的延迟降低。
本地LLM推理优化:完整指南
一份关于在消费级硬件上优化本地LLM推理的全面指南,涵盖llama.cpp、vLLM和LM Studio等工具,并提供关于内存层次结构、层放置和常见故障模式的实用建议。
流式系统中事件触发大语言模型调用的不确定性感知序贯决策规则
本文将在流式推理系统中何时调用大语言模型的问题形式化为基于风险的序贯停止问题。文中证明了理论保证,并在涡扇退化数据上对框架进行了实证验证。