[开源] dlmserve —— 首个扩散语言模型服务引擎

Reddit r/LocalLLaMA 工具

摘要

dlmserve 是首个面向扩散语言模型的开源服务引擎,提供兼容 OpenAI 的 API、持续批处理功能,在 12GB VRAM 内即可运行,吞吐量是 Hugging Face 的 2.5 倍。

过去几个月,我一直在用一张 **RTX 5070** 构建这个项目。简要背景:**扩散语言模型**(如 gsai-ml 的 [LLaDA](https://huggingface.co/gsai-ml/LLaDA-8B-Instruct))与 GPT 风格的自回归 LLM 截然不同。它们不是逐个生成 token,而是从一个完全掩码的句子开始,然后以并行方式迭代地“去噪”整个序列。技术很酷,但主流服务引擎都是围绕自回归范式构建的,因此没有一个能服务于扩散 LLM。**dlmserve** 填补了这一空白:* 兼容 OpenAI 的 HTTP API (`/v1/chat/completions`) * 在**去噪步级别**的自动持续批处理 * 内置可选的 **LocalLeap** 加速 * 在 `temperature=0` 时与参考 HF 实现**完全 token 一致** * 在 `batch=4` 时吞吐量**是 HF 的 2.5 倍**,再加上 **~1.8 倍**的 LocalLeap 加速 仅需 **12 GB VRAM**(RTX 3090/4090/5070 均可)。MIT 许可。**仓库:** [https://github.com/iOptimizeThings/dlmserve](https://github.com/iOptimizeThings/dlmserve) **安装:** `pipx install dlmserve`(如果你在虚拟环境中,也可以 `pip install dlmserve`)这是我首个公开发布的这个规模的开源项目。非常好奇大家的想法。欢迎反馈和代码审查,也很乐意回答关于扩散服务架构的问题。编辑:路线图:- v0.1 ✓ LLaDA-8B-Instruct + LLaDA-1.5 - v0.2 Dream-7B + DiffuLLaMA(已开 issue)- v0.3 block diffusion + LLaDA-2.0 + Fast-dLLM KV 缓存
查看原文

相似文章