Qwen3.8-Flash-Next 在 MLX-serve 上发布,支持 100 万上下文!

Reddit r/LocalLLaMA 工具

摘要

该文章宣布了 Qwen3.8-Flash-Next 在 MLX-serve 上的发布,支持 100 万 token 上下文,并在 M5 Max 硬件上使用量化权重实现了高效性能。

嗨,我是 MLX-serve 中 Qwen3.8-Flash-Next 引擎支持的共同创建者。我一直在调优这个引擎,使其在 M5 Max 128GB 上使用 kv cache 8 位时能够快速、高效且正确地处理高达 100 万上下文。Qwen 在非常长的上下文中表现良好,如视频所示(在约 76 万上下文时的快照),我让它构建了 MLX Serve Monitor 插件,您在 Opencode2 应用的右侧看到过。生成过程在 100 万上下文中持续进行,文本约 40 令牌/秒,编码约 75 令牌/秒。这个特定的量化使用 8 位用于密集层,4 位用于专家层,因此模型质量保持很高。我构建这个引擎不是为了在非常短的上下文中炫耀令牌/秒或重复的贪婪生成,而是为了通过深度上下文工作进行真实的温度 1.0 采样。在尝试 100 万完整上下文之前,您需要设置 iogpu.wired_limit_mb=120000,因为峰值内存使用量约为 117GB。这里会有一些错误,我无法测试所有内容和每个用例,请报告。您可以在这里获取:https://github.com/ddalcu/mlx-serve 模型权重:https://huggingface.co/ddalcu/Qwen3.8-Flash-Next-MLX-Serve-mixed-4-8bit Opencode2 插件:https://github.com/beamivalice/opencode2-mlx-serve 启动参数(用于 1 并发)--model ./llm/models/Qwen3.8-Flash-Next-MLX-Serve-mixed-4-8bit \ --host 127.0.0.1 \ --port 11234 \ --ctx-size 1048576 \ --kv-quant 8 \ --max-tokens 64000 \ --mtp \ --prefix-cache-mem 10GB \ --prefix-cache-entries 1 \ --ssm-checkpoint-max 16 \ --metrics
查看原文

相似文章

Qwen3.8-Flash-Next

Simon Willison's Blog

Qwen 发布了 Qwen3.8-Flash-Next,这是一款开放权重的多模态 MoE 模型,拥有 125B tokens,但只有 6B 活跃参数,提供了性能提升,并作为 Qwen4 架构的早期预览。

Qwen3.8-Flash-Next 针对 Mac 优化版

Reddit r/LocalLLaMA

本文详细介绍了在 Mac M1 Max 硬件上运行 Qwen3.8-Flash-Next AI 模型的自定义优化,包括 SSD 流、自定义量化和稀疏注意力机制,以提升性能。