Flash-dLLM:IO感知的KV缓存和并行解码,用于快速、内存高效的扩散LLMs
摘要
Flash-dLLM是一个用于扩散LLMs的免训练推理加速框架,它通过IO感知的KV缓存和并行解码来实现显著的加速和内存效率提升。
查看缓存全文
缓存时间: 2026/09/23 03:32
论文页面 - Flash-dLLM:面向快速内存高效扩散大语言模型的IO感知KV缓存与并行解码
来源:https://huggingface.co/papers/2609.26796
摘要
扩散大语言模型(dLLMs)作为一种有前景的自回归LLM替代方案近期崭露头角,实现了非自回归文本生成。然而,其实际部署仍受推理效率低下的制约,这主要源于缺乏有效的键值(KV)缓存与可扩展的并行解码机制。现有加速方法通常孤立地研究KV缓存与并行解码,忽略了缓存复用与并行令牌验证共同应用时出现的I/O瓶颈。本文提出Flash-dLLM,一个无需训练的推理加速框架,用于实现快速且内存高效的dLLM推理。Flash-dLLM首先识别出GPU内存I/O是KV缓存使能的dLLM推理中的主要瓶颈,并通过一个I/O感知的融合KV缓存内核来减少冗余内存搬运以解决该问题。基于此优化缓存机制,Flash-dLLM进一步提出一种高效的KV缓存驱动草稿-验证解码策略,其中dLLM自身同时充当草稿生成器与验证器,无需辅助模型。这种统一设计在保持生成质量的同时实现了更快解码,并提升了对更长序列和更大批次的可扩展性。在数学推理与代码生成基准测试上的大量实验表明,Flash-dLLM在推理速度和内存效率方面均持续优于现有的最先进dLLM加速方法。特别是在GSM8K和HumanEval上,它分别实现了比先前最强基线Elastic-Cache快5.1倍和11.0倍的加速。
查看arXiv页面 (https://arxiv.org/abs/2609.26796) 查看PDF (https://arxiv.org/pdf/2609.26796) GitHub2 (https://github.com/VILA-Lab/Flash-dLLM) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.26796)
在您的代理中获取此论文:
hf papers read 2609.26796
没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在模型README.md中引用 arxiv.org/abs/2609.26796 以从本页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集README.md中引用 arxiv.org/abs/2609.26796 以从本页面链接。
引用此论文的Spaces0
没有Space链接此论文
在Space README.md中引用 arxiv.org/abs/2609.26796 以从本页面链接。
包含此论文的收藏夹0
没有包含此论文的收藏夹
将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以从本页面链接。
相似文章
Dynamic-dLLM:动态缓存预算与自适应并行解码,实现扩散大语言模型的无训练加速
本文提出 Dynamic-dLLM,一种无训练框架,通过动态分配缓存更新预算和校准解码阈值来加速扩散大语言模型,在 LLaDA 和 Dream 等模型上实现超过 3 倍的加速,同时保持性能。
@_avichawla: 研究人员发现了一种让大语言模型(LLM)提速 8.5 倍的方法!(且不影响准确度)投机解码相当有效……
研究人员提出了 DFlash 技术,这是一种利用块扩散模型(block diffusion models)进行投机解码的方法,可在不损失准确度的情况下,将大语言模型推理速度提升高达 8.5 倍。该技术已集成到 vLLM 和 SGLang 等主要框架中。
Fast-dLLM++:用于更快扩散LLM推理的Fr\'{e}chet剖面解码
Fast-dLLM++ 引入了适用于扩散LLM的Fr\'{e}chet剖面解码,这是一种无需训练的方法,基于异构置信度剖面选择并行提交集。在LLaDA-8B模型的基准测试中,它实现了高达37%的吞吐量提升,同时保持可比的准确性。
Prefilling-dLLM:扩散语言模型中长上下文推理的预测性预填充
本文提出Prefilling-dLLM,一种无需训练的框架,它将前缀分割成块并缓存KV表示,在扩散语言模型的长上下文推理中实现了最先进的质量和高达28倍的加速。
@simplifyinAI: 研究人员刚刚通过零精度损失将 LLM 的速度提升了 8.5 倍。这项技术被称为 DFlash。它取代了缓慢的自回归…
研究人员提出了 DFlash,这是一种用块扩散模型替代自回归草稿模型的方法,在零精度损失的情况下实现了 8.5 倍的 LLM 推理加速。