LuffyTheFox/Swift-Qwen3.8-27B-Genesis-GGUF

Reddit r/LocalLLaMA 模型

摘要

用户探索了Swift-Qwen3.8-7B模型的量化变体,采用GGUF格式,指出其紧凑的尺寸允许在32GB显存中使用完整的262k上下文,并报告了基准性能。

最近偶然发现了这个模型:LuffyTheFox/Swift-Qwen3.8-27B-Genesis-GGUF 我通常避开那些“神奇”模型,但这个模型的尺寸吸引了我的注意:具备视觉能力的情况下,它小于17GB,这意味着我可以在32GB显存中使用完整的上下文大小(262k),更大的ubatch,以及mtp4。当然,视觉部分使用RAM,而不是GPU。其他类似的nvfp4系列模型,通常大小为19-20GB或更大。我用llama.cpp尝试过,速度在40-113 t/s之间(在我的基准测试中为76 t/s),上下文为262k。在正常的代理工作下,速度为45-65 t/s。(使用2x5060ti16GB OC)例如,使用vllm的thinkingcap nvfp,我只能有160k的上下文(无法将mmproj卸载到RAM)乍一看,其质量与其他swift模型(nvfp4)相同。所以我的问题是,这个模型有什么取舍?
查看原文

相似文章

LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V6-GGUF

Hugging Face Models Trending

LuffyTheFox 发布了 Qwen3.6-35B-A3B 模型的 GGUF 量化版本,使用 Genesis 算法进行去噪,以减少张量噪声并改进指令遵循能力,该模型基于一个未经审查的激进变体,并与 Hermes 微调数据合并。

LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V5-GGUF

Hugging Face Models Trending

LuffyTheFox 发布了 Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V5-GGUF,这是 Qwen 模型的一个修改版本,使用 Genesis 后训练算法通过自定义 SVD 对 GGUF 格式张量进行信号纯度修复和噪声降低。

Qwen3.6 27B Pure Quant: 16 GB 显存下 40 tok/s

Reddit r/LocalLLaMA

使用纯 Q4_K_M 方法对 Qwen3.6 27B 进行量化的版本完全适配 16 GB 显存,在 MTP 下可实现高达 40 tok/s 的 token 生成速度,相比其他 GGUF 变体显著缩小模型体积。