[开源] dlmserve —— 首个扩散语言模型服务引擎
摘要
dlmserve 是首个面向扩散语言模型的开源服务引擎,提供兼容 OpenAI 的 API、持续批处理功能,在 12GB VRAM 内即可运行,吞吐量是 Hugging Face 的 2.5 倍。
过去几个月,我一直在用一张 **RTX 5070** 构建这个项目。简要背景:**扩散语言模型**(如 gsai-ml 的 [LLaDA](https://huggingface.co/gsai-ml/LLaDA-8B-Instruct))与 GPT 风格的自回归 LLM 截然不同。它们不是逐个生成 token,而是从一个完全掩码的句子开始,然后以并行方式迭代地“去噪”整个序列。技术很酷,但主流服务引擎都是围绕自回归范式构建的,因此没有一个能服务于扩散 LLM。**dlmserve** 填补了这一空白:* 兼容 OpenAI 的 HTTP API (`/v1/chat/completions`) * 在**去噪步级别**的自动持续批处理 * 内置可选的 **LocalLeap** 加速 * 在 `temperature=0` 时与参考 HF 实现**完全 token 一致** * 在 `batch=4` 时吞吐量**是 HF 的 2.5 倍**,再加上 **~1.8 倍**的 LocalLeap 加速 仅需 **12 GB VRAM**(RTX 3090/4090/5070 均可)。MIT 许可。**仓库:** [https://github.com/iOptimizeThings/dlmserve](https://github.com/iOptimizeThings/dlmserve) **安装:** `pipx install dlmserve`(如果你在虚拟环境中,也可以 `pip install dlmserve`)这是我首个公开发布的这个规模的开源项目。非常好奇大家的想法。欢迎反馈和代码审查,也很乐意回答关于扩散服务架构的问题。编辑:路线图:- v0.1 ✓ LLaDA-8B-Instruct + LLaDA-1.5 - v0.2 Dream-7B + DiffuLLaMA(已开 issue)- v0.3 block diffusion + LLaDA-2.0 + Fast-dLLM KV 缓存
相似文章
BlockServe: 块粒度连续批处理实现高吞吐扩散大语言模型服务
BlockServe 引入了块粒度连续批处理来解决扩散大语言模型中的收敛异质性,相比 Fast-dLLM 实现了 1.9–10.6 倍的吞吐量提升,同时保持生成质量。
@vllm_project: 祝贺@GoogleDeepMind推出DiffusionGemma——一个基于Gemma4主干网络的260亿参数扩散语言模型,也是首个dLLM……
vLLM宣布原生支持Google DeepMind的DiffusionGemma,这是一个260亿参数的离散扩散语言模型,能够并行生成256个token的块,在单个H200上实现1200+ tok/s的低延迟推理。
@kazukifujii: 加州大学圣地亚哥分校Hao AI实验室的博客非常清晰地解释了DistServe的Prefill Decode分离的实用性…
加州大学圣地亚哥分校Hao AI实验室的博客清晰解释了DistServe的Prefill Decode分离技术,追溯了该技术从2024年到2025年的被接受过程,并关联了NVIDIA Dynamo、llm-d、Ray Serve LLM、LMCache和MoonCake等相关技术,是学习LLM推理的绝佳起点。
@_avichawla: https://x.com/_avichawla/status/2077653695123378321
本文认为,vLLM及类似的服务框架由于设计限制,在单个GPU上运行多个小型AI模型时效率低下。它介绍了SIE开源推理引擎,作为同时服务多个模型以降低成本的一种解决方案。
Dynamic-dLLM:动态缓存预算与自适应并行解码,实现扩散大语言模型的无训练加速
本文提出 Dynamic-dLLM,一种无训练框架,通过动态分配缓存更新预算和校准解码阈值来加速扩散大语言模型,在 LLaDA 和 Dream 等模型上实现超过 3 倍的加速,同时保持性能。