RTX5090, gemma-4-31B-it-Q6_K.gguf。上下文:之前 - 35k,之后 - 80k!

Reddit r/LocalLLaMA 新闻

摘要

在RTX 5090上运行量化后的Gemma-4-31B模型,上下文长度从35k增加到80k,展示了显著的性能提升。

暂无内容
查看原文

相似文章

DiffusionGemma 26B A4B 在我5090上的结果

Reddit r/LocalLLaMA

本文介绍了在RTX 5090 GPU上运行DiffusionGemma 26B A4B GGUF模型的基准测试结果及调优参数,通过优化温度设置和量化选择实现最高44%的加速。