Flash-dLLM:IO感知的KV缓存和并行解码,用于快速、内存高效的扩散LLMs

Hugging Face Daily Papers 论文

摘要

Flash-dLLM是一个用于扩散LLMs的免训练推理加速框架,它通过IO感知的KV缓存和并行解码来实现显著的加速和内存效率提升。

扩散大语言模型(dLLMs)最近作为一种有前景的替代自回归LLMs的方案出现,实现了非自回归文本生成。然而,它们的实际部署仍受限于低效的推理,主要原因是缺乏有效的键值(KV)缓存和可扩展的并行解码机制。现有的加速方法通常孤立地研究KV缓存和并行解码,忽略了当缓存重用和并行令牌验证联合应用时出现的I/O瓶颈。在这项工作中,我们介绍了Flash-dLLM,一个用于快速且内存高效的dLLMs的免训练推理加速框架。Flash-dLLM首先将GPU内存I/O确定为启用KV缓存的dLLM推理中的主要瓶颈,并使用一个I/O感知的融合KV缓存内核来减少冗余内存移动,从而解决这一问题。基于这一优化的缓存机制,Flash-dLLM进一步提出了一种高效的KV缓存驱动的草稿与验证解码策略,其中dLLM本身既作为草稿器又作为验证器,无需辅助模型。这种统一的设计在保持生成质量的同时实现了更快的解码,并提高了对更长序列和更大批量大小的可扩展性。在数学推理和代码生成基准测试上的大量实验表明,Flash-dLLM在推理速度和内存效率方面始终优于现有的最先进dLLM加速方法。特别是在GSM8K和HumanEval上,它分别实现了相对于之前最强基线Elastic-Cache的5.1倍和11.0倍的加速。
查看原文
查看缓存全文

缓存时间: 2026/09/23 03:32

论文页面 - Flash-dLLM:面向快速内存高效扩散大语言模型的IO感知KV缓存与并行解码

来源:https://huggingface.co/papers/2609.26796

摘要

扩散大语言模型(dLLMs)作为一种有前景的自回归LLM替代方案近期崭露头角,实现了非自回归文本生成。然而,其实际部署仍受推理效率低下的制约,这主要源于缺乏有效的键值(KV)缓存与可扩展的并行解码机制。现有加速方法通常孤立地研究KV缓存与并行解码,忽略了缓存复用与并行令牌验证共同应用时出现的I/O瓶颈。本文提出Flash-dLLM,一个无需训练的推理加速框架,用于实现快速且内存高效的dLLM推理。Flash-dLLM首先识别出GPU内存I/O是KV缓存使能的dLLM推理中的主要瓶颈,并通过一个I/O感知的融合KV缓存内核来减少冗余内存搬运以解决该问题。基于此优化缓存机制,Flash-dLLM进一步提出一种高效的KV缓存驱动草稿-验证解码策略,其中dLLM自身同时充当草稿生成器与验证器,无需辅助模型。这种统一设计在保持生成质量的同时实现了更快解码,并提升了对更长序列和更大批次的可扩展性。在数学推理与代码生成基准测试上的大量实验表明,Flash-dLLM在推理速度和内存效率方面均持续优于现有的最先进dLLM加速方法。特别是在GSM8K和HumanEval上,它分别实现了比先前最强基线Elastic-Cache快5.1倍和11.0倍的加速。

查看arXiv页面 (https://arxiv.org/abs/2609.26796) 查看PDF (https://arxiv.org/pdf/2609.26796) GitHub2 (https://github.com/VILA-Lab/Flash-dLLM) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.26796)

在您的代理中获取此论文:

hf papers read 2609.26796

没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

在模型README.md中引用 arxiv.org/abs/2609.26796 以从本页面链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集README.md中引用 arxiv.org/abs/2609.26796 以从本页面链接。

引用此论文的Spaces0

没有Space链接此论文

在Space README.md中引用 arxiv.org/abs/2609.26796 以从本页面链接。

包含此论文的收藏夹0

没有包含此论文的收藏夹

将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以从本页面链接。

相似文章

Fast-dLLM++:用于更快扩散LLM推理的Fr\'{e}chet剖面解码

arXiv cs.CL

Fast-dLLM++ 引入了适用于扩散LLM的Fr\'{e}chet剖面解码,这是一种无需训练的方法,基于异构置信度剖面选择并行提交集。在LLaDA-8B模型的基准测试中,它实现了高达37%的吞吐量提升,同时保持可比的准确性。