@_akhaliq: Unlocking Lossless Speedups in LLMs via Discrete Diffusion 论文: https://huggingface.co/papers/2609.04010…
摘要
本文提出了一种使用离散扩散的方法,以在大型语言模型中实现无损加速,旨在提高效率而不影响性能。
Unlocking Lossless Speedups in LLMs via Discrete Diffusion
论文: https://t.co/POqau2xMHp https://t.co/iqz1jNoD4t
查看缓存全文
缓存时间: 2026/09/09 07:50
通过离散扩散模型实现大语言模型的无损加速
论文链接:https://t.co/POqau2xMHp https://t.co/iqz1jNoD4t
相似文章
扩散以压缩:利用扩散语言模型实现无损压缩
本文介绍了扩散语言模型(DLMs)作为一种新的无损文本压缩推理范式,旨在克服基于自回归LLM的压缩器的吞吐量瓶颈,同时实现最先进的压缩率。
Dynamic-dLLM:动态缓存预算与自适应并行解码,实现扩散大语言模型的无训练加速
本文提出 Dynamic-dLLM,一种无训练框架,通过动态分配缓存更新预算和校准解码阈值来加速扩散大语言模型,在 LLaDA 和 Dream 等模型上实现超过 3 倍的加速,同时保持性能。
LaCache: 扩散大语言模型的精确缓存与精度自适应推理
LaCache 提出了一种针对扩散式LLM的无训练加速框架,利用无损缓存和精度自适应推理消除去噪步骤中的冗余计算,在保持任务精度的同时实现了高达40.2倍的端到端加速。
DC-Leap: 通过草稿引导的连续跳跃解码实现dLLMs的无训练加速
提出DC-Leap,一种无训练框架,通过引入动态连续验证和草稿引导解码来加速扩散大语言模型,在保持生成质量的同时实现高达105倍的加速。
@_yucheng_lu: MTP 使自回归 LLM 变快。同样的技巧能否用于扩散语言模型?与 @modal 进行了一次有趣的合作,探索……
介绍了多令牌残差预测(MRP)技术,该技术通过预测相邻去噪步骤之间的残差来加速扩散语言模型推理,在 SGLang 中实现了最高 1.56 倍的速度提升,并在激进解码设置中恢复了最高 +16 的准确率点数。