@simplifyinAI: 研究人员刚刚通过零精度损失将 LLM 的速度提升了 8.5 倍。这项技术被称为 DFlash。它取代了缓慢的自回归…
摘要
研究人员提出了 DFlash,这是一种用块扩散模型替代自回归草稿模型的方法,在零精度损失的情况下实现了 8.5 倍的 LLM 推理加速。
研究人员刚刚在零精度损失的情况下将 LLM 的速度提升了 8.5 倍。这项技术被称为 DFlash。它用块扩散模型取代了投机解码(speculative decoding)中缓慢的自回归草稿模型,能够一次性并行预测所有 token。
→ 传统方式:48.5 tokens/秒
→ DFlash:415 tokens/秒
→ 相同模型。相同质量。已与 vLLM、SGLang 和 Transformers 集成。HuggingFace 上提供了适用于 Qwen3、Llama 3.1、Kimi-K2.5、gpt-oss 等模型的草稿模型。100% 开源。
相似文章
@_avichawla: 研究人员发现了一种让大语言模型(LLM)提速 8.5 倍的方法!(且不影响准确度)投机解码相当有效……
研究人员提出了 DFlash 技术,这是一种利用块扩散模型(block diffusion models)进行投机解码的方法,可在不损失准确度的情况下,将大语言模型推理速度提升高达 8.5 倍。该技术已集成到 vLLM 和 SGLang 等主要框架中。
Flash-dLLM:IO感知的KV缓存和并行解码,用于快速、内存高效的扩散LLMs
Flash-dLLM是一个用于扩散LLMs的免训练推理加速框架,它通过IO感知的KV缓存和并行解码来实现显著的加速和内存效率提升。
@DivyanshT91162: 自回归大语言模型可能正在被取代 有人构建了dLLM——一个开源库,可以将任何自…
dLLM是一个开源库,可将任何自回归大语言模型转换为扩散大语言模型,实现并行解码和更快的文本生成。
@zhijianliu_: DFlash 现已在生产推理堆栈中运行。更多草稿模型即将推出。https://github.com/z-lab/dflash
DFlash 是一个用于投机解码的轻量级块扩散模型,现已支持 Qwen 和 Gemma 等各种大语言模型并投入生产环境使用。
@LiorOnAI:现在你可以将任何LLM转换成更快的版本,而无需从头重新训练。NVIDIA刚刚在他们30B的模型上实现了这一点。她…
NVIDIA提出了一种方法,将任何LLM转换为更快的版本,方法是将模型拆分为两个副本:一个冻结用于上下文,另一个训练用于并行生成多个token,实现了2.4倍加速,且质量保留约99%,仅使用了8%的训练数据。