@Ex0byt: 开放前沿智能,尽在掌握——MiniMax-M3 PRISM Dynamic-Quant 配方已就绪!428B参数压缩…
摘要
MiniMax-M3 PRISM Dynamic-Quant 配方通过逐张量敏感性排序,将428B参数模型从约450GB压缩至119GB,并计划进一步剪枝至60-80GB,以便本地部署。
查看缓存全文
缓存时间: 2026/06/15 02:51
开放前沿智能,尽在掌握——MiniMax-M3 PRISM 动态量化方案现已就绪!将原本约450GB的MXFP8版本、参数规模达428B的模型,压缩至119GB,通过逐张量灵敏度排序,保护注意力路径与共享专家路径(3.4–4.5 bpw),针对两个最大的路由专家张量块进行深度压缩。但对于大多数本地设备而言仍显庞大,因此下一步我们将裁剪那些不会影响智能体与编码性能的专家模块,目标压缩至60–80GB。
相似文章
@TeksEdge: 随着MiniMax M3开源发布,以下是关于量化版本和模型大小的预期,包括所需VRAM:MiniMax M3 (428…
MiniMax M3是一款428B参数的MoE模型,活跃参数约23B,现已开源。它支持超长上下文(最高达1M)并提升了效率,提供了多种量化尺寸以及本地部署所需的VRAM要求。
@no_stp_on_snek: MiniMax-M3 的 Config-I 量化版本已发布在 MLX 上。2-bit 专家、4-bit 注意力、8-bit 边界与嵌入、f16 路由器。约…
发布了 MiniMax-M3 的 Config-I 量化版本,在 MLX 上使用 2-bit 专家和 4-bit 注意力,将 427B MoE 模型从 869GB 减少到约 167GB,但该量化版本未经测试且需要为 mlx_lm 打补丁。
@stevibe:MiniMax M2.7 有 230B 参数,家里真能跑?我用 Unsloth 的 UD-IQ3_XXS(80 GB)在 4 套配置上实测:…
MiniMax M2.7 有 230B 参数,家里真能跑?我用 Unsloth 的 UD-IQ3_XXS(80 GB)在 4 套配置上实测:4×RTX 4090(96 GB):71.52 tok/s,首 token 延迟 1045 ms;4×RTX 5090(128 GB):120.54 tok/s,首 token 延迟 725 ms;1×RTX PRO 6000(96 GB):118.74 tok/s,首 token 延迟 765 ms;DGX
@TheAhmadOsman: 一直在玩@PrismML的新模型,该模型将Qwen 3.5 27B变成了子4GB和子6GB的权重,令我印象深刻 C…
PrismML发布了一个压缩版的Qwen 3.5 27B,可以装入子4GB和子6GB内存中,实现了令人印象深刻的本地AI性能。
@dealignai: MiniMax m3,专为 128GB Mac 打造。感谢 @hornsby_andrew 准备剪枝校准数据集并进行…
经过剪枝和量化的 MiniMax-M3 版本(MiniMax-M3-Medium-JANG_2L),针对使用 vMLX 在 128GB Mac 上运行进行了优化,采用 32% 专家剪枝和 JANG_2L 混合精度量化,使其占用空间约 105 GB。