Qwen3.8-Flash-Next 在 MLX-serve 上发布,支持 100 万上下文!
摘要
该文章宣布了 Qwen3.8-Flash-Next 在 MLX-serve 上的发布,支持 100 万 token 上下文,并在 M5 Max 硬件上使用量化权重实现了高效性能。
嗨,我是 MLX-serve 中 Qwen3.8-Flash-Next 引擎支持的共同创建者。我一直在调优这个引擎,使其在 M5 Max 128GB 上使用 kv cache 8 位时能够快速、高效且正确地处理高达 100 万上下文。Qwen 在非常长的上下文中表现良好,如视频所示(在约 76 万上下文时的快照),我让它构建了 MLX Serve Monitor 插件,您在 Opencode2 应用的右侧看到过。生成过程在 100 万上下文中持续进行,文本约 40 令牌/秒,编码约 75 令牌/秒。这个特定的量化使用 8 位用于密集层,4 位用于专家层,因此模型质量保持很高。我构建这个引擎不是为了在非常短的上下文中炫耀令牌/秒或重复的贪婪生成,而是为了通过深度上下文工作进行真实的温度 1.0 采样。在尝试 100 万完整上下文之前,您需要设置 iogpu.wired_limit_mb=120000,因为峰值内存使用量约为 117GB。这里会有一些错误,我无法测试所有内容和每个用例,请报告。您可以在这里获取:https://github.com/ddalcu/mlx-serve 模型权重:https://huggingface.co/ddalcu/Qwen3.8-Flash-Next-MLX-Serve-mixed-4-8bit Opencode2 插件:https://github.com/beamivalice/opencode2-mlx-serve 启动参数(用于 1 并发)--model ./llm/models/Qwen3.8-Flash-Next-MLX-Serve-mixed-4-8bit \ --host 127.0.0.1 \ --port 11234 \ --ctx-size 1048576 \ --kv-quant 8 \ --max-tokens 64000 \ --mtp \ --prefix-cache-mem 10GB \ --prefix-cache-entries 1 \ --ssm-checkpoint-max 16 \ --metrics
相似文章
Qwen3.8-Flash-Next 在单张96 GB显卡上支持170K上下文窗口,速度约110 tokens/秒。
本文介绍了一种使用量化n-gram运行Qwen3.8-Flash-Next模型的方法,可在单张96GB显卡上实现超过17万token的上下文长度。通过INT4量化技术配合内存映射磁盘访问,处理速度最高可达每秒110个token。
Qwen3.8-Flash-Next
Qwen 发布了 Qwen3.8-Flash-Next,这是一款开放权重的多模态 MoE 模型,拥有 125B tokens,但只有 6B 活跃参数,提供了性能提升,并作为 Qwen4 架构的早期预览。
在128 GB M5 Max上运行Qwen3.8-Flash-Next(79 GB,2-bit)以350K上下文持续3.5小时——速度与上下文深度权衡,100轮对话,一张图表
本文报告了在MacBook Pro M5 Max上运行Qwen3.8-Flash-Next模型的情况,对100轮对话中速度与上下文深度进行基准测试,并深入分析性能及长上下文下角色混淆等问题。
Qwen3.7 开源权重即将发布的首个证据。Qwen3.7-flash 已出现在 OpenRouter 上。他们曾将 Qwen3.6-35b-a3b 称为 Qwen3.6 flash,因此这很可能是一个小型 MoE。其价格远低于 3.6 flash,且原生支持 100 万上下文窗口。
Qwen3.7 开源权重即将发布的证据,其 flash 变体(很可能是小型 MoE)已出现在 OpenRouter 上,具有 100 万上下文窗口,且价格比 Qwen3.6 flash 更低。
Qwen3.8-Flash-Next 针对 Mac 优化版
本文详细介绍了在 Mac M1 Max 硬件上运行 Qwen3.8-Flash-Next AI 模型的自定义优化,包括 SSD 流、自定义量化和稀疏注意力机制,以提升性能。