标签
vLLM宣布原生支持Google DeepMind的DiffusionGemma,这是一个260亿参数的离散扩散语言模型,能够并行生成256个token的块,在单个H200上实现1200+ tok/s的低延迟推理。
作者详细介绍了尝试在Nvidia 5090 GPU上使用qlora以及来自open-dllm和d3LLM的修改来本地训练Qwen 3.6 27B自回归到扩散模型的过程,在探索单步扩散技术时遇到了显存限制和硬件问题。