@no_stp_on_snek: 非常棒。对3090团队来说意义重大。而且TurboQuant+已经在很多推理引擎中实现了。
摘要
一条回复对Unsloth AI即将推出的Qwen3.8-27B模型表示赞赏,该模型将能在17GB内存/显存配置下运行,并指出TurboQuant+已集成到众多推理引擎中——这对RTX 3090用户来说是个好消息。
非常棒。对3090团队来说意义重大。而且TurboQuant+已经在很多推理引擎中实现了。
查看缓存全文
缓存时间: 2026/08/03 15:46
太棒了。对3090用户来说是个巨大好消息。而且TurboQuant+已经在多个推理引擎中实现了。
Unsloth AI (@UnslothAI): Qwen3.8-27B即将到来!🔥
将能在17GB RAM/VRAM配置下本地运行。
相似文章
@no_stp_on_snek: 这太厉害了!3090 级别的 GPU 欢呼吧!
Unsloth AI 发布了量化版 Qwen3.6 模型,在消费级 GPU 上运行速度快了 2.5 倍。其中 27B 模型可适配 24GB 显存,35B-A3B 模型实现了高吞吐量。
@rumgewieselt:现在变得疯狂了……三块 1080 Ti(Pascal架构,33GB VRAM)Qwen 3.6 27B MTP 搭配 196K TurboQuant,持续 ~28-30 t/s
一位用户成功在三个 GTX 1080 Ti GPU 上对 27B 参数的 Qwen 模型进行本地推理,通过 TurboQuant 优化达到了约 28-30 tokens/秒的速度。
Wow!Qwen 3.6:35b-a3b 在 3090 上……太惊人了。
一位用户分享了在二手 RTX 3090 上运行量化版 Qwen 3.6:35b-a3b 模型的惊人结果:将模型放入显存后,输出速度达到每秒 160 个 token,并以 75 秒的视频处理时间展示了视觉能力。
@superalesha: 别急着埋葬RTX 3090,先读完这个!@UnslothAI本周发布了qwen3.6-35b的两个新4位量化版本。我花了…
对Qwen3.6-35B在RTX 3090上的nvfp4、nvfp4-fast和AWQ 4位量化进行了基准测试,结果显示性能相近,而MTP头技巧将吞吐量提升了41%。
@MiaAI_lab: Nvidia又做到了!@NVIDIAAI的Qwen 3.6 27B NVFP4比Unsloth的Qwen 3.6 27B NVFP4在D…上快了约41%
Nvidia优化后的Qwen 3.6 27B NVFP4模型在DGX Spark上相比Unsloth版本,单次推理速度快41%,并发推理速度快23-25%。