在4090上以高达475t/s运行DiffusionGemma 26b……以及一些想法

Reddit r/LocalLLaMA 模型

摘要

一位用户分享了他们在4090 GPU上通过vLLM运行DiffusionGemma 26B的经验,速度高达475t/s,但指出了单用户限制、准确度较低和上下文短等缺点,并认为它不值得替代常规的26B模型。

我想着发点信息给其他也想在3090/4090上折腾这个模型的人。显然我无法使用nvfp4,但我通过vLLM使用diffusiongemma-26B-A4B-it-AWQ-INT4让它跑起来了。必须使用他们为此提供的定制vLLM Docker镜像运行,然后加载一个gemma 4工具/推理解析器。一切就绪后,第一个提示词就达到了475t/s,并且根据输出长度和上下文,运行速度似乎在290t/s到700t/s之间(长输出非常快)。不过它相当重,所以你得不到长上下文(我测试了8k,本可以更高,但高不了太多)。缺点?它只能单用户使用(如果尝试批处理就会变慢),响应明显更差(会犯常规的26ba4b不会犯的错误),而且它无法在大海捞针中找到目标(上下文消失得很快)。短提示词的首token时间也比常规LLM稍慢(它要扩散所有内容并一次性给出所有块,所以获取第一个块需要更长时间)。值得折腾吗?我觉得不值得。常规的26ba4b通过llama.cpp运行时,批处理时仍能达到超过300t/s,而且准确度高得多。
查看原文

相似文章

DifussionGemma 4 on 4x7900xtx

Reddit r/LocalLLaMA

报告了在四块AMD 7900 XTX GPU上使用vllm运行DiffusionGemma 26B,生成时达到100 tps,总时间约为45-60 t/s(包括提示处理等待时间),并分享了性能指标和设置命令。

DiffusionGemma 26B A4B 在我5090上的结果

Reddit r/LocalLLaMA

本文介绍了在RTX 5090 GPU上运行DiffusionGemma 26B A4B GGUF模型的基准测试结果及调优参数,通过优化温度设置和量化选择实现最高44%的加速。

Gemma 4 26B 在单块 RTX 5090 上达到 600 Tok/s

Reddit r/LocalLLaMA

一项基准测试显示,使用 vLLM 搭配 DFlash 投机解码,在单块 RTX 5090 上将 Gemma 4 26B 的推理速度提升至约 578 tokens/s,相比基线实现了 2.56 倍的加速。