@no_stp_on_snek: MiniMax-M3 的 Config-I 量化版本已发布在 MLX 上。2-bit 专家、4-bit 注意力、8-bit 边界与嵌入、f16 路由器。约…
摘要
发布了 MiniMax-M3 的 Config-I 量化版本,在 MLX 上使用 2-bit 专家和 4-bit 注意力,将 427B MoE 模型从 869GB 减少到约 167GB,但该量化版本未经测试且需要为 mlx_lm 打补丁。
查看缓存全文
缓存时间: 2026/06/16 19:39
Config-I quant of MiniMax-M3 is up on MLX. 2-bit experts, 4-bit attention, 8-bit boundaries + embeddings, f16 router. ~167GB.
Have I run it? No. Can I run it? Also no. My machine takes one look at this thing and files for divorce.
Shipped blind. If you’ve got the RAM, load it and tell me if it’s a genius or brain damage.
thetom-ai/MiniMax-M3-ConfigI-MLX · Hugging Face
Source: https://huggingface.co/thetom-ai/MiniMax-M3-ConfigI-MLX
https://huggingface.co/thetom-ai/MiniMax-M3-ConfigI-MLX#minimax-m3-turboquant-config-i-mlxMiniMax-M3, TurboQuant+ Config-I (MLX)
https://huggingface.co/thetom-ai/MiniMax-M3-ConfigI-MLX#%E2%9A%A0%EF%B8%8F-untested-model-use-at-your-own-risk⚠️ 未经测试的模型,使用风险自负 我因没有足够的磁盘/内存来托管或运行此模型,因此该模型未经验证。**未在此次 M3 量化版本上执行困惑度、MMLU、大海捞针或生成测试。下方的大小和每权重比特数是转换后的测量输出;**关于输出质量的所有内容均未验证。**它可能产生损坏或降级的输出。Config-I策略本身已在其他MoE模型上得到验证(参见MiniMax-M2.7-ConfigI-MLX (https://huggingface.co/thetom-ai/MiniMax-M2.7-ConfigI-MLX),MMLU 93.5%),M3使用相同的策略,但M3是不同的、更大的架构(
minimax_m3_vl,约427B),尚未独立确认能在2比特专家压缩下存活。**使用前请先验证。**如果您运行它,请报告结果。
https://huggingface.co/thetom-ai/MiniMax-M3-ConfigI-MLX#%F0%9F%94%A7-patch-required-m3-is-not-in-stock-mlx_lm-yet🔧 需要补丁:M3尚未包含在官方
mlx_lm中 MiniMax-M3(minimax_m3_vl)在已发布的mlx_lm中没有相应的模型类。上游支持正在进行中,此量化版本是基于ml-explore/mlx-lm#1398 (https://github.com/ml-explore/mlx-lm/pull/1398)(另见#1401 (https://github.com/ml-explore/mlx-lm/pull/1401))构建的。在这些PR合并之前,您需要手动添加该模型类。有两种方法: - 在此仓库中捆绑提供:minimax_m3_vl.py已包含在此仓库中,将其放入您的mlx_lm/models/目录中即可。 - **从PR获取:**拉取PR分支,或运行pip install "git+https://github.com/ml-explore/mlx-lm.git@refs/pull/1398/head"。一旦#1398/#1401合并到正式版本中,官方的mlx_lm即可加载此模型,无需补丁。
MiniMaxAI/MiniMax-M3的Config-I量化版本(https://huggingface.co/MiniMaxAI/MiniMax-M3)(总计约427B MoE,60层,每层128个专家 top-4 + 1个共享专家)。MoE/注意力权重采用Config-I量化;视觉塔和MiniMax稀疏注意力(MSA)索引器权重保留为bf16,以便未来支持VL/MSA的MLX可以使用它们(当前的mlx_lm会忽略这些权重,仅以纯文本模式运行模型,并使用密集注意力)。该策略对专家MLP(MoE最容忍压缩的部分)采用激进的2比特压缩,将注意力保护在4比特,并以更高精度保护边界层、路由和嵌入向量。有关策略推导,请参阅Config-I论文 (https://github.com/TheTom/turboquant_plus/blob/main/docs/papers/weight-compression-tq4.md)。
https://huggingface.co/thetom-ai/MiniMax-M3-ConfigI-MLX#compression压缩
| 大小 | |
|---|---|
| bf16源文件 | ~869 GB |
| MXFP8源文件(用于此次转换) | ~444 GB |
| Config-I(量化权重 3.097 bpw)+ bf16视觉/MSA | ~167 GB |
| 相比bf16减少 | ~81% |
包含为向前兼容而保留的bf16视觉塔和MSA索引器(额外+2.2 GB)。
从官方的MXFP8检查点(https://huggingface.co/MiniMaxAI/MiniMax-M3-MXFP8)转换而来(FP8权重在加载时反量化)。敏感层(路由器门、嵌入向量、lm_head)在MXFP8源中已是全精度,因此Config-I的FP8→低比特转换仅作用于它所要压缩的专家/注意力权重。
https://huggingface.co/thetom-ai/MiniMax-M3-ConfigI-MLX#quality质量
**未测量。**请查看顶部的警告。此处故意不列出与已验证的M2.7版本相伴的MMLU / PPL / NIAH / 吞吐量表,因为针对此M3量化版本不存在此类测量数据。
https://huggingface.co/thetom-ai/MiniMax-M3-ConfigI-MLX#config-i-policy-minimax-m3-adaptationConfig-I策略(MiniMax-M3适配)
| 组件 | 比特数 | 层 | 原理 |
|---|---|---|---|
| 专家MLP gate/up (w1/w3) | 2-bit | 中间56层 | 参数主体,MoE可容忍 |
| 专家MLP down (w2) | 3-bit | 中间56层 | 写回敏感性(Config-I发现) |
| 注意力 Q/K/V/O | 4-bit | 中间56层 | 每层统一 |
| 边界(所有张量) | 8-bit | 前2层 + 后2层 | 边界层保护 |
| MoE路由器 | f16 | 全部 | 路由精度关键 |
| 嵌入向量 + lm_head | 8-bit | 已保护 |
标准的MLX每层量化会对MiniMax类MoE模型产生破坏性输出,因为它将注意力和路由压缩到与专家MLP相同的比特数。Config-I保护了控制连贯性的组件,同时压缩了约97%的参数(专家MLP),这些参数对压缩的容忍度较高。
https://huggingface.co/thetom-ai/MiniMax-M3-ConfigI-MLX#compatibility兼容性
| 字段 | 值 |
|---|---|
| 格式 | MLX safetensors (标准) |
| 平均比特数 | 3.097 bpw (量化权重;视觉+MSA索引保持bf16) |
| 运行时 | mlx_lm (Python), mlx-swift-lm (Swift) |
| 模型类型 | minimax_m3_vl (文本主干) |
| 平台 | Apple Silicon,需要约200 GB统一内存(M3 Ultra 256 GB / M系列192 GB+) |
| 量化日期 | 2026-06-14 |
采用标准MLX每层量化,但M3支持是新的,需要上述补丁(参见“🔧 需要补丁“):minimax_m3_vl模型类尚未包含在发布的mlx_lm中。请使用捆绑的minimax_m3_vl.py(放入mlx_lm/models/目录)或正在进行的PR#1398 (https://github.com/ml-explore/mlx-lm/pull/1398)。
https://huggingface.co/thetom-ai/MiniMax-M3-ConfigI-MLX#how-to-run如何运行
https://huggingface.co/thetom-ai/MiniMax-M3-ConfigI-MLX#python-mlx_lmPython (mlx_lm)
# 需要 minimax_m3_vl 支持,请使用捆绑的 minimax_m3_vl.py 或 PR #1398
#(参见上面的 "🔧 需要补丁")。然后:
python -m mlx_lm.generate --model thetom-ai/MiniMax-M3-ConfigI-MLX --prompt "Hello"
from mlx_lm import load, generate
model, tokenizer = load("thetom-ai/MiniMax-M3-ConfigI-MLX")
print(generate(model, tokenizer, prompt="Hello", max_tokens=256, temp=1.0, top_p=0.95))
**注意:**MiniMax模型是“始终推理”的,请使用
temperature=1.0;贪婪/temp=0可能导致无限思考循环。
https://huggingface.co/thetom-ai/MiniMax-M3-ConfigI-MLX#limitations-current-loader当前加载器的限制
使用当前的minimax_m3_vl加载器(PR #1398),此模型作为纯文本、密集注意力模型运行:
- **无图像输入。**视觉塔权重包含在仓库中,但加载器尚未启用VL推理;它们目前是死重量,直到MLX添加M3-VL支持,届时无需重新量化。
- **密集注意力,非MSA。**MiniMax稀疏注意力作为完整因果注意力运行,数值上精确(质量相等或更好),但长上下文速度更慢/需要更多KV缓存。MSA索引器权重已保留(bf16),供未来支持MSA的加载器使用。
这两点都是有意的:保留权重是为了使模型向前兼容,无需重新从源文件量化。
https://huggingface.co/thetom-ai/MiniMax-M3-ConfigI-MLX#what-is-config-i什么是Config-I?
Config-I是TurboQuant+中的一种张量角色感知权重压缩策略。通过系统的A/B隔离,发现注意力张量、FFN读投影(gate/up)、FFN写回投影(down)和边界层具有截然不同的压缩敏感性。关键洞察是:压缩策略比压缩算法更重要:即压缩哪些张量、保护哪些张量以及压缩的激进程度。对于MoE模型,专家MLP在参数数量上占主导地位,但由于每个token仅激活128个专家中的少数几个,因此它们能容忍激进的压缩;Config-I将它们压缩到2-3比特,同时保护注意力和路由。
此量化版本使用convert_m3.py (https://github.com/TheTom/turboquant_plus) 从MXFP8检查点生成。按原样分享,未经测试,供拥有相应硬件的人评估。
相似文章
@TeksEdge: 随着MiniMax M3开源发布,以下是关于量化版本和模型大小的预期,包括所需VRAM:MiniMax M3 (428…
MiniMax M3是一款428B参数的MoE模型,活跃参数约23B,现已开源。它支持超长上下文(最高达1M)并提升了效率,提供了多种量化尺寸以及本地部署所需的VRAM要求。
JANGQ-AI/MiniMax-M2.7-JANGTQ_K : MiniMax M2.7 的混合位量化版本 - 磁盘占用 74 GB
发布了 MiniMax M2.7 模型的混合位量化版本,优化至 74 GB,以便在 Apple Silicon 设备上高效进行本地推理。
@stevibe:MiniMax M2.7 有 230B 参数,家里真能跑?我用 Unsloth 的 UD-IQ3_XXS(80 GB)在 4 套配置上实测:…
MiniMax M2.7 有 230B 参数,家里真能跑?我用 Unsloth 的 UD-IQ3_XXS(80 GB)在 4 套配置上实测:4×RTX 4090(96 GB):71.52 tok/s,首 token 延迟 1045 ms;4×RTX 5090(128 GB):120.54 tok/s,首 token 延迟 725 ms;1×RTX PRO 6000(96 GB):118.74 tok/s,首 token 延迟 765 ms;DGX
@Ex0byt: 开放前沿智能,尽在掌握——MiniMax-M3 PRISM Dynamic-Quant 配方已就绪!428B参数压缩…
MiniMax-M3 PRISM Dynamic-Quant 配方通过逐张量敏感性排序,将428B参数模型从约450GB压缩至119GB,并计划进一步剪枝至60-80GB,以便本地部署。
@dealignai: MiniMax m3,专为 128GB Mac 打造。感谢 @hornsby_andrew 准备剪枝校准数据集并进行…
经过剪枝和量化的 MiniMax-M3 版本(MiniMax-M3-Medium-JANG_2L),针对使用 vMLX 在 128GB Mac 上运行进行了优化,采用 32% 专家剪枝和 JANG_2L 混合精度量化,使其占用空间约 105 GB。