Qwen3.8-Next 流式传输 - M5 Air 上预填充 150 tps,解码 3.6 tps

Reddit r/LocalLLaMA 新闻

摘要

一位用户在 Apple M5 Air 上测试了 Qwen3.8-Next 模型,采用 3 位量化,实现了预填充 150 令牌/秒和解码 3.6 令牌/秒,在某些指标上超过了密集 270 亿参数模型。

出于好奇,我想看看能否将几周前的 DSv4 流式处理栈适配以支持 Qwen3.8-Next。它成功了,而且比预期更好——实际上在我的 32GB M5 上运行得比密集 270 亿模型更快(诚然不完全可比,因为我决定使用 MoE 的 3 位版本 Qwen3.8-Flash-Next-MLX-oQ3-MTP,而密集模型是 4 位)。对于 2000 令牌的提示,在我的 M5 上以低功耗模式运行,3.8-Next-3bit 实现预填充 150 tps,解码 3.6 tps。270 亿-4 位模型实现预填充 70 tps,解码 3 tps。
查看原文

相似文章

Qwen3.8-Flash-Next 针对 Mac 优化版

Reddit r/LocalLLaMA

本文详细介绍了在 Mac M1 Max 硬件上运行 Qwen3.8-Flash-Next AI 模型的自定义优化,包括 SSD 流、自定义量化和稀疏注意力机制,以提升性能。

Qwen 27B

Reddit r/LocalLLaMA

一位用户报告称,在q6kxl量化与多token预测下,Qwen 27B在4090+3090系统上使用LCPP实现了50-90 token/s的解码速度和1500-2200 token/s的预填充速度,并指出它在各种编码任务中表现稳定、快速且连贯。

Wow!Qwen 3.6:35b-a3b 在 3090 上……太惊人了。

Reddit r/artificial

一位用户分享了在二手 RTX 3090 上运行量化版 Qwen 3.6:35b-a3b 模型的惊人结果:将模型放入显存后,输出速度达到每秒 160 个 token,并以 75 秒的视频处理时间展示了视觉能力。