标签
该文章宣布了 Qwen3.8-Flash-Next 在 MLX-serve 上的发布,支持 100 万 token 上下文,并在 M5 Max 硬件上使用量化权重实现了高效性能。
一位开发者更新了 MLX-Serve(一个面向 Apple Silicon 的快速本地推理服务器),以支持近期模型,如 LiquidAI 2.6B、MiniMax H3 视频生成和 DeepSeek V4 Flash,AntLing 3.0-flash 即将推出。