{基于HBF的有趣论文}2607.10186] FlashAccel: 利用高带宽闪存(HBF)实现高吞吐量LLM推理

Reddit r/LocalLLaMA 论文

摘要

FlashAccel是一个协同设计的系统,它将高带宽闪存集成到GPU中以增强LLM推理,通过减轻访问延迟和优化带宽利用来提高吞吐量和能效。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/30 14:05

# FlashAccel:利用高带宽闪存(HBF)实现高吞吐量大语言模型推理
来源:https://arxiv.org/html/2607.10186
薛亚龙、孙晓天、张晓宇、张新江、窦春萌、李雪琪、陈晓明
致谢:
本工作部分由中国国家自然科学基金资助(资助号:62488101 和 62495104),部分由中国科学院青年创新促进会资助。\(通讯作者:X\. 陈\)
致谢:
X\. 王任职于中国科学院计算技术研究所(北京 100190,中国),同时兼任中国科学院大学(北京 101408,中国)(邮箱:wangxinyu22s@ict\.ac\.cn\)。
致谢:
Y\. 薛任职于中国科学院大学前沿交叉科学学院(北京 101408,中国),同时兼任中国科学院计算技术研究所(北京 100190,中国)(邮箱:xueyalong22@mails\.ucas\.ac\.cn\)。
致谢:
C\. 窦任职于中国科学院微电子研究所(北京 100029,中国)(邮箱:douchunmeng@ime\.ac\.cn\)。
致谢:
X\. 孙、张晓宇、张新江、X\. 李和 X\. 陈任职于中国科学院计算技术研究所(北京 100190,中国)(邮箱:sunxiaotian21s@ict\.ac\.cn; zhangxiaoyu@ict\.ac\.cn; zhangxinjiang@ict\.ac\.cn; lixueqi@ict\.ac\.cn; chenxiaoming@ict\.ac\.cn\)。
###### 摘要
大语言模型(LLM)的推理日益受到 GPU 中高带宽内存(HBM)容量的限制,因为模型权重和 KV 缓存正在快速增长。高带宽闪存(HBF)提供了比 HBM 更高的容量,同时提供相当的带宽,使其成为容量受限的 LLM 推理的有前景的基底。然而,其固有的高访问延迟、低带宽利用率以及缺乏对异构资源管理的支持,使得将 HBF 集成到 GPU 中用于 LLM 推理变得困难。我们提出了 FlashAccel,一个协同设计的系统,能够使用 HBF 实现高效的 LLM 推理。FlashAccel 将 HBF 集成到基于 HBM 的 GPU 中,提供架构支持以缓解访问延迟。它通过为模型权重和 KV 缓存设计专门的数据布局来提高带宽利用率,并引入了一个 HBF 感知的存储管理层以及一个编程模型,以组织 HBF 中的持久化数据并在系统层面协调异构内存资源。实验结果表明,将六个 HBF 堆栈集成到 GPU 中,使 FlashAccel 在 100ms 延迟约束下,平均每 GPU 吞吐量和能效分别比仅使用 HBM 的 GPU 提升了 2.49×\times 和 1.93×\times。
###### 索引术语:高带宽闪存,LLM 推理,异构内存。
## I 引言
大语言模型(LLM)的快速发展正推动推理工作负载向多轮交互\[14 (https://arxiv.org/html/2607.10186#bib.bib29)\]、智能体\[44 (https://arxiv.org/html/2607.10186#bib.bib17)\]和长上下文处理\[6 (https://arxiv.org/html/2607.10186#bib.bib18)\]方向发展。更大的模型扩展了权重占用空间,而更长的上下文增加了 KV 缓存的大小\[7 (https://arxiv.org/html/2607.10186#bib.bib10)\]。这些趋势从根本上增加了推理系统的内存容量需求。然而,GPU 中高带宽内存(HBM)的容量并未跟上内存需求的快速增长。图1 (https://arxiv.org/html/2607.10186#S1.F1)显示,尽管 GPU 内存容量随时间稳步增长,但流行模型的内存占用增长速度要快得多。如今,模型的大小可能超过 TB,远远超过单个 GPU 最多几百 GB 的容量。同时,在过去两年中,上下文长度平均增长了 4×\times\[4 (https://arxiv.org/html/2607.10186#bib.bib8)\],按比例增加了 KV 缓存的存储需求。有限的 HBM 容量在 LLM 推理中引入了几个关键挑战。首先,在内存受限的解码阶段,内存容量不足限制了批处理大小,导致计算利用率和吞吐量低下。其次,内存压力常常迫使 KV 缓存提前被驱逐,阻止了多轮交互中的重用机会,并增加了重新计算开销\[24 (https://arxiv.org/html/2607.10186#bib.bib12)\]。第三,由于单个 GPU 的容量有限,存储大型模型需要多 GPU 系统,这会带来显著的硬件成本,并引入额外的 GPU 间通信、任务调度和容错复杂性。先前的工作\[46 (https://arxiv.org/html/2607.10186#bib.bib4), 38 (https://arxiv.org/html/2607.10186#bib.bib3), 26 (https://arxiv.org/html/2607.10186#bib.bib2)\]利用闪存来解决容量瓶颈。它们通常将模型权重存储在闪存中,并使用存储内计算来利用内部并行性。然而,这些工作主要针对边缘场景设计。其有限的带宽和计算能力不足以满足需要强大计算设备(即 GPU)以及同时具备大容量和高带宽的内存设备的高吞吐量场景的需求。为了同时提供高带宽和大容量,高带宽闪存(HBF)应运而生。HBF 是一种特殊的闪存,它提供与 HBM 相当的带宽,同时保留了闪存的高密度和非易失性\[18 (https://arxiv.org/html/2607.10186#bib.bib1), 19 (https://arxiv.org/html/2607.10186#bib.bib15)\]。通过将 HBF 与 HBM 一起集成到 GPU 中,我们可以显著扩展内存容量,以实现潜在更高的解码吞吐量。然而,这种容量优势并不会自动转化为吞吐量提升。几个关键挑战阻碍了利用 HBF 实现高吞吐量推理。首先,闪存存在固有的高访问延迟\[8 (https://arxiv.org/html/2607.10186#bib.bib11)\],这可能会增加端到端延迟。其次,尽管 HBF 提供高峰值带宽,但它需要高度并行才能达到峰值带宽。低效的数据布局会限制并行访问机会,导致低带宽利用率。第三,集成 HBF 引入了异构内存资源,带来了管理这些资源并向软件暴露高效抽象的挑战。解决这些挑战需要硬件-软件协同设计。我们提出了 FlashAccel,一个协同设计架构、数据布局和系统软件的加速器系统,以高效地将 HBF 集成到基于 GPU 的 LLM 推理中。在架构上,FlashAccel 通过分布在 HBF 芯片上的 SRAM 缓存进行数据预取来缓解闪存访问延迟。它将 HBF、HBM 和 GPU 核心集成到一个统一的加速器中,以缓解容量瓶颈。在数据布局层面,FlashAccel 通过为权重和 KV 缓存设计专门的布局来解决 HBF 的低带宽利用率挑战,从而在推理期间实现高并行性。在系统层面,FlashAccel 提供了一个 HBF 感知的存储管理层来组织 HBF 中的持久化数据,以及一个编程模型,允许应用程序高效地利用异构内存资源。总而言之,我们做出了以下贡献。 - •我们识别了将 HBF 用于 LLM 推理的关键挑战,包括影响端到端延迟的高访问延迟、峰值读取带宽与 LLM 工作负载下有效带宽之间的差距,以及缺乏对异构内存资源的管理。 - •我们介绍了 FlashAccel,一个基于 HBF 的高吞吐量 LLM 服务加速器。FlashAccel 结合了硬件-软件协同设计技术,以隐藏高访问延迟、实现权重和 KV 缓存的近峰值带宽,并高效管理异构资源。 - •实验结果表明,与仅使用 HBM 的 GPU 实现相比,FlashAccel 显著将吞吐量和能效分别提升了 2.49×\times 和 1.93×\times。 参见图注 图1:HBM 内存容量和模型大小的趋势。
## II 背景与动机
### II-A LLM 工作负载
LLM 由多个堆叠的 transformer 层组成,每层都需要存储静态模型权重(所有请求共享)和动态 KV 缓存(每个请求隔离)。LLM 推理由具有不同计算特性的预填充(prefill)和解码(decode)阶段组成\[24 (https://arxiv.org/html/2607.10186#bib.bib12)\]。预填充阶段同时处理所有输入令牌,使其主要是计算密集型。在解码阶段,每个请求每个推理步骤提供一个令牌,导致频繁访问模型权重和 KV 缓存,这使其成为内存密集型。随着 KV 缓存在推理步骤中增长,大多数框架\[48 (https://arxiv.org/html/2607.10186#bib.bib19), 24 (https://arxiv.org/html/2607.10186#bib.bib12)\]采用 PagedAttention 风格的机制\[24 (https://arxiv.org/html/2607.10186#bib.bib12)\],将 KV 缓存划分为固定大小的块进行细粒度内存分配,减少碎片并提高内存利用率。框架还管理 KV 缓存淘汰。请求完成后,计算出的 KV 缓存会保留在内存中,以供未来请求可能重用。当内存耗尽时,框架会驱逐历史 KV 缓存以服务新请求。
### II-B 内存容量瓶颈
模型权重和 KV 缓存的快速增长使 GPU 的 HBM 容量成为 LLM 推理的根本瓶颈。这一瓶颈直接限制了解码阶段的批处理大小。考虑在配备 80GB HBM 的 H100 GPU\[30 (https://arxiv.org/html/2607.10186#bib.bib20)\]上运行 Qwen3-32B\[43 (https://arxiv.org/html/2607.10186#bib.bib5)\]。在为模型权重预留约 64GB 后,仅剩 16GB 可用于 KV 缓存。对于 8K 上下文长度,每个请求需要约 2GB KV 缓存,这意味着 GPU 最多只能支持大小为 8 的批处理。根据 Roofline 模型\[41 (https://arxiv.org/html/2607.10186#bib.bib21)\],更大的批处理大小增加了与权重相关操作的算术强度,从而提高了 GPU 利用率。图2 (https://arxiv.org/html/2607.10186#S2.F2)\(a\)显示,小的批处理大小限制了吞吐量,而更大的批处理大小显著提高了吞吐量,同时对延迟的影响很小。HBM 容量进一步限制了 KV 缓存的重用机会。图2 (https://arxiv.org/html/2607.10186#S2.F2)\(b\)说明了多轮交互中的重用机会。前几轮生成的 KV 缓存可以在未来轮次的预填充阶段被重用,从而避免重新计算这些 KV 缓存。然而,重用需要将 KV 缓存保留在内存中。在上面的例子中,每个请求需要 2GB 的 KV 缓存,这意味着单个 GPU 只能存储八个请求的 KV 缓存。当服务更多请求时,KV 缓存会经常被驱逐,导致缓存命中率低并增加额外的重新计算开销。先前的工作\[39 (https://arxiv.org/html/2607.10186#bib.bib22)\]表明,实现高重用效率可能需要多达 4×\times 的额外 KV 缓存内存容量。图2:(a) 批处理的好处。所有结果均使用 Qwen3-32B 的 8 层配置获得(由于容量限制,对于完整模型,H100 仅支持小于 8 的批处理大小)。(b) KV 缓存重用的好处。当前的 LLM 推理系统通过扩展到多个 GPU 来缓解内存容量限制,但这增加了部署成本、系统复杂性和 GPU 间通信开销。因此,在保持高带宽的同时增加每 GPU 内存容量提供了一个更有前景的替代方案。
### II-C 用于 LLM 推理的闪存
参见图注 图3:闪存架构。(a) 物理结构。(b) 逻辑结构。闪存因其高存储密度而成为缓解容量瓶颈的有吸引力的选择。如图3 (https://arxiv.org/html/2607.10186#S2.F3)\(a\)所示,一个闪存芯片包括通过混合键合\[50 (https://arxiv.org/html/2607.10186#bib.bib13)\]堆叠在电路芯片上的阵列芯片。阵列芯片使用垂直堆叠的 NAND 单元存储数据,而电路芯片集成外围电路。图3 (https://arxiv.org/html/2607.10186#S2.F3)\(b\)显示了闪存的层次结构:通道-芯片-平面-块-页。一个闪存设备由多个通道组成,每个通道作为一个独立接口,由一个或多个芯片共享。每个芯片包含多个平面,这些平面在电路芯片中具有独立的读写路径,支持 NAND 阵列与页缓冲区之间的并行数据交换。在一个平面内,块是擦除操作的单位,而页是读和编程操作的单位。最近的工作,如 AiF\[26 (https://arxiv.org/html/2607.10186#bib.bib2)\]、Lincoln\[38 (https://arxiv.org/html/2607.10186#bib.bib3)\]和 Cambricon-LLM\[46 (https://arxiv.org/html/2607.10186#bib.bib4)\]使用闪存进行 LLM 推理。它们将模型权重存储在闪存中,并将计算单元放置在闪存内部以利用平面级并行性。这些设计实现了边缘推理,但不适合高吞吐量推理。这些设计仅提供数百 GB/s 的带宽和几 TFLOPS 的计算能力,远低于现代 GPU。带宽和计算能力的这些限制直接限制了推理吞吐量。此外,它们仅在闪存中存储模型权重,而忽略了庞大的 KV 缓存占用空间。一种更有前景的使用闪存加速 LLM 推理的方法是将高带宽的闪存设备与 GPU 集成,以缓解其容量瓶颈。实现高带宽的关键是利用平面级并行性。HBF 可以通过增加每个芯片的平面数量(例如,将一个芯片划分为 16 个平面\[35 (https://arxiv.org/html/2607.10186#bib.bib9)\])、采用类似 HBM 的 3D 堆叠\[22 (https://arxiv.org/html/2607.10186#bib.bib23)\]以实现跨多个闪存芯片的并行性,以及利用 TSV 在闪存和 GPU 之间提供高带宽互连来实现。将 KV 缓存存储在闪存中的主要顾虑是耐久性。例如,单级单元(SLC)闪存通常提供约 100K 次 P/E 循环\[29 (https://arxiv.org/html/2607.10186#bib.bib24)\]。先前的工作\[38 (https://arxiv.org/html/2607.10186#bib.bib3), 26 (https://arxiv.org/html/2607.10186#bib.bib2), 46 (https://arxiv.org/html/2607.10186#bib.bib4)\]避免将频繁更新的 KV 缓存存储在闪存中以规避耐久性限制。然而,最近注意力机制的进步使得在闪存中存储 KV 缓存成为可能。根据 DeepSeek 的报告\[13 (https://arxiv.org/html/2607.10186#bib.bib38)\],预填充集群(约 764 个 GPU)每天写入 2660 亿个新令牌[^1]。基于这些输入,解码集群(约 1,051 个 GPU)额外生成 1680 亿个令牌。根据这些统计数据,预填充集群中的每个 GPU 每天写入 22.7TB 的 KV 缓存,而解码集群中的每个 GPU 每天写入 26.9TB 的 KV 缓存。SLC 闪存在 5 年使用寿命内每天可提供约 55 次 P/E 循环。因此,一个 1TB 的 HBF 设备每天可承受约 55TB 的数据写入,这足以满足推理工作负载的需求。此外,放宽保持时间保证可以将耐久性提高多达 50×\times\[27 (https://arxiv.org/html/2607.10186#bib.bib36), 9 (https://arxiv.org/html/2607.10186#bib.bib37)\],使闪存成为实用的介质。

相似文章

Hot Chips 2026: 高带宽闪存(HBF)技术应用

Hacker News Top

在Hot Chips 2026上的一场演讲探讨了高带宽闪存(HBF)技术及其在机器学习领域的潜在应用,重点介绍了利用vLLM将模型权重和KV缓存存储在HBF中以提升容量的方案。

高带宽闪存为模型权重提供高效存储

Hacker News Top

IEEE Spectrum报道了高带宽闪存(HBF),这是一种新型内存技术,通过使用高带宽内存(HBM)封装技术堆叠NAND闪存芯片,大幅提升读取带宽,实现对LLM模型权重的高效存储。首批产品预计约一年内推出。

@charles_irl: dflash 高速运转

X AI KOLs Timeline

NVIDIA 宣布推出 DFlash,一种用于推测解码的开源块扩散模型,在 Blackwell GPU 上可实现高达 15 倍的推理吞吐量提升,同时保持交互性。