标签
一位用户分享了他们在4090 GPU上通过vLLM运行DiffusionGemma 26B的经验,速度高达475t/s,但指出了单用户限制、准确度较低和上下文短等缺点,并认为它不值得替代常规的26B模型。
本文介绍了在RTX 5090 GPU上运行DiffusionGemma 26B A4B GGUF模型的基准测试结果及调优参数,通过优化温度设置和量化选择实现最高44%的加速。
Super Gemma 4 26B Uncensored GGUF v2 是一个社区微调模型,提供无审查的回复,零拒绝,改进的速度,修复了工具调用,针对 llama.cpp 和 vLLM 上的本地推理进行了优化。