LuffyTheFox/Swift-Qwen3.8-27B-Genesis-GGUF
摘要
用户探索了Swift-Qwen3.8-7B模型的量化变体,采用GGUF格式,指出其紧凑的尺寸允许在32GB显存中使用完整的262k上下文,并报告了基准性能。
最近偶然发现了这个模型:LuffyTheFox/Swift-Qwen3.8-27B-Genesis-GGUF 我通常避开那些“神奇”模型,但这个模型的尺寸吸引了我的注意:具备视觉能力的情况下,它小于17GB,这意味着我可以在32GB显存中使用完整的上下文大小(262k),更大的ubatch,以及mtp4。当然,视觉部分使用RAM,而不是GPU。其他类似的nvfp4系列模型,通常大小为19-20GB或更大。我用llama.cpp尝试过,速度在40-113 t/s之间(在我的基准测试中为76 t/s),上下文为262k。在正常的代理工作下,速度为45-65 t/s。(使用2x5060ti16GB OC)例如,使用vllm的thinkingcap nvfp,我只能有160k的上下文(无法将mmproj卸载到RAM)乍一看,其质量与其他swift模型(nvfp4)相同。所以我的问题是,这个模型有什么取舍?
相似文章
LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V6-GGUF
LuffyTheFox 发布了 Qwen3.6-35B-A3B 模型的 GGUF 量化版本,使用 Genesis 算法进行去噪,以减少张量噪声并改进指令遵循能力,该模型基于一个未经审查的激进变体,并与 Hermes 微调数据合并。
LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V5-GGUF
LuffyTheFox 发布了 Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V5-GGUF,这是 Qwen 模型的一个修改版本,使用 Genesis 后训练算法通过自定义 SVD 对 GGUF 格式张量进行信号纯度修复和噪声降低。
LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V3-GGUF
一种新的无审查GGUF模型,基于Qwen3.6-35B-A3B,采用数据重建和噪声抑制技术进行技术改进。通过一种新颖的修复方法,降低了拒绝率并提升了性能。
Qwen3.6 27B Pure Quant: 16 GB 显存下 40 tok/s
使用纯 Q4_K_M 方法对 Qwen3.6 27B 进行量化的版本完全适配 16 GB 显存,在 MTP 下可实现高达 40 tok/s 的 token 生成速度,相比其他 GGUF 变体显著缩小模型体积。
DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
DavidAU 发布了 Qwen3.6-27B-Fable-Fusion-711,这是一个对 Qwen 3.6 27B 进行多阶段微调的模型,声称在 ARC-C 基准测试中超过 700 分,超越了基础模型并匹敌闭源模型,提供 GGUF 格式,适用于消费级硬件。