@no_stp_on_snek: MiniMax-M3 的 Config-I 量化版本已发布在 MLX 上。2-bit 专家、4-bit 注意力、8-bit 边界与嵌入、f16 路由器。约…

X AI KOLs Following 模型

摘要

发布了 MiniMax-M3 的 Config-I 量化版本,在 MLX 上使用 2-bit 专家和 4-bit 注意力,将 427B MoE 模型从 869GB 减少到约 167GB,但该量化版本未经测试且需要为 mlx_lm 打补丁。

MiniMax-M3 的 Config-I 量化版本已在 MLX 上发布了。2-bit 专家、4-bit 注意力、8-bit 边界与嵌入、f16 路由器。约 167GB。 我跑过它吗?没有。我能跑它吗?也不能。我的机器一看这玩意儿就直接申请离婚了。 盲发版。如果你有足够的内存,加载它,然后告诉我它是天才还是脑残。
查看原文
查看缓存全文

缓存时间: 2026/06/16 19:39

Config-I quant of MiniMax-M3 is up on MLX. 2-bit experts, 4-bit attention, 8-bit boundaries + embeddings, f16 router. ~167GB.

Have I run it? No. Can I run it? Also no. My machine takes one look at this thing and files for divorce.

Shipped blind. If you’ve got the RAM, load it and tell me if it’s a genius or brain damage.


thetom-ai/MiniMax-M3-ConfigI-MLX · Hugging Face

Source: https://huggingface.co/thetom-ai/MiniMax-M3-ConfigI-MLX

https://huggingface.co/thetom-ai/MiniMax-M3-ConfigI-MLX#minimax-m3-turboquant-config-i-mlxMiniMax-M3, TurboQuant+ Config-I (MLX)

https://huggingface.co/thetom-ai/MiniMax-M3-ConfigI-MLX#%E2%9A%A0%EF%B8%8F-untested-model-use-at-your-own-risk⚠️ 未经测试的模型,使用风险自负 我因没有足够的磁盘/内存来托管或运行此模型,因此该模型未经验证。**未在此次 M3 量化版本上执行困惑度、MMLU、大海捞针或生成测试。下方的大小和每权重比特数是转换后的测量输出;**关于输出质量的所有内容均未验证。**它可能产生损坏或降级的输出。Config-I策略本身已在其他MoE模型上得到验证(参见MiniMax-M2.7-ConfigI-MLX (https://huggingface.co/thetom-ai/MiniMax-M2.7-ConfigI-MLX),MMLU 93.5%),M3使用相同的策略,但M3是不同的、更大的架构(minimax_m3_vl,约427B),尚未独立确认能在2比特专家压缩下存活。**使用前请先验证。**如果您运行它,请报告结果。

https://huggingface.co/thetom-ai/MiniMax-M3-ConfigI-MLX#%F0%9F%94%A7-patch-required-m3-is-not-in-stock-mlx_lm-yet🔧 需要补丁:M3尚未包含在官方mlx_lm中 MiniMax-M3(minimax_m3_vl)在已发布的mlx_lm中没有相应的模型类。上游支持正在进行中,此量化版本是基于ml-explore/mlx-lm#1398 (https://github.com/ml-explore/mlx-lm/pull/1398)(另见#1401 (https://github.com/ml-explore/mlx-lm/pull/1401))构建的。在这些PR合并之前,您需要手动添加该模型类。有两种方法: - 在此仓库中捆绑提供:minimax_m3_vl.py已包含在此仓库中,将其放入您的mlx_lm/models/目录中即可。 - **从PR获取:**拉取PR分支,或运行pip install "git+https://github.com/ml-explore/mlx-lm.git@refs/pull/1398/head"。一旦#1398/#1401合并到正式版本中,官方的mlx_lm即可加载此模型,无需补丁。

MiniMaxAI/MiniMax-M3的Config-I量化版本(https://huggingface.co/MiniMaxAI/MiniMax-M3)(总计约427B MoE,60层,每层128个专家 top-4 + 1个共享专家)。MoE/注意力权重采用Config-I量化;视觉塔和MiniMax稀疏注意力(MSA)索引器权重保留为bf16,以便未来支持VL/MSA的MLX可以使用它们(当前的mlx_lm会忽略这些权重,仅以纯文本模式运行模型,并使用密集注意力)。该策略对专家MLP(MoE最容忍压缩的部分)采用激进的2比特压缩,将注意力保护在4比特,并以更高精度保护边界层、路由和嵌入向量。有关策略推导,请参阅Config-I论文 (https://github.com/TheTom/turboquant_plus/blob/main/docs/papers/weight-compression-tq4.md)。

https://huggingface.co/thetom-ai/MiniMax-M3-ConfigI-MLX#compression压缩

大小
bf16源文件~869 GB
MXFP8源文件(用于此次转换)~444 GB
Config-I(量化权重 3.097 bpw)+ bf16视觉/MSA~167 GB
相比bf16减少~81%

包含为向前兼容而保留的bf16视觉塔和MSA索引器(额外+2.2 GB)。

从官方的MXFP8检查点(https://huggingface.co/MiniMaxAI/MiniMax-M3-MXFP8)转换而来(FP8权重在加载时反量化)。敏感层(路由器门、嵌入向量、lm_head)在MXFP8源中已是全精度,因此Config-I的FP8→低比特转换仅作用于它所要压缩的专家/注意力权重。

https://huggingface.co/thetom-ai/MiniMax-M3-ConfigI-MLX#quality质量

**未测量。**请查看顶部的警告。此处故意不列出与已验证的M2.7版本相伴的MMLU / PPL / NIAH / 吞吐量表,因为针对此M3量化版本不存在此类测量数据。

https://huggingface.co/thetom-ai/MiniMax-M3-ConfigI-MLX#config-i-policy-minimax-m3-adaptationConfig-I策略(MiniMax-M3适配)

组件比特数原理
专家MLP gate/up (w1/w3)2-bit中间56层参数主体,MoE可容忍
专家MLP down (w2)3-bit中间56层写回敏感性(Config-I发现)
注意力 Q/K/V/O4-bit中间56层每层统一
边界(所有张量)8-bit前2层 + 后2层边界层保护
MoE路由器f16全部路由精度关键
嵌入向量 + lm_head8-bit已保护

标准的MLX每层量化会对MiniMax类MoE模型产生破坏性输出,因为它将注意力和路由压缩到与专家MLP相同的比特数。Config-I保护了控制连贯性的组件,同时压缩了约97%的参数(专家MLP),这些参数对压缩的容忍度较高。

https://huggingface.co/thetom-ai/MiniMax-M3-ConfigI-MLX#compatibility兼容性

字段
格式MLX safetensors (标准)
平均比特数3.097 bpw (量化权重;视觉+MSA索引保持bf16)
运行时mlx_lm (Python), mlx-swift-lm (Swift)
模型类型minimax_m3_vl (文本主干)
平台Apple Silicon,需要约200 GB统一内存(M3 Ultra 256 GB / M系列192 GB+)
量化日期2026-06-14

采用标准MLX每层量化,但M3支持是新的,需要上述补丁(参见“🔧 需要补丁“):minimax_m3_vl模型类尚未包含在发布的mlx_lm中。请使用捆绑的minimax_m3_vl.py(放入mlx_lm/models/目录)或正在进行的PR#1398 (https://github.com/ml-explore/mlx-lm/pull/1398)。

https://huggingface.co/thetom-ai/MiniMax-M3-ConfigI-MLX#how-to-run如何运行

https://huggingface.co/thetom-ai/MiniMax-M3-ConfigI-MLX#python-mlx_lmPython (mlx_lm)

# 需要 minimax_m3_vl 支持,请使用捆绑的 minimax_m3_vl.py 或 PR #1398
#(参见上面的 "🔧 需要补丁")。然后:
python -m mlx_lm.generate --model thetom-ai/MiniMax-M3-ConfigI-MLX --prompt "Hello"
from mlx_lm import load, generate
model, tokenizer = load("thetom-ai/MiniMax-M3-ConfigI-MLX")
print(generate(model, tokenizer, prompt="Hello", max_tokens=256, temp=1.0, top_p=0.95))

**注意:**MiniMax模型是“始终推理”的,请使用temperature=1.0;贪婪/temp=0可能导致无限思考循环。

https://huggingface.co/thetom-ai/MiniMax-M3-ConfigI-MLX#limitations-current-loader当前加载器的限制

使用当前的minimax_m3_vl加载器(PR #1398),此模型作为纯文本、密集注意力模型运行:

  • **无图像输入。**视觉塔权重包含在仓库中,但加载器尚未启用VL推理;它们目前是死重量,直到MLX添加M3-VL支持,届时无需重新量化。
  • **密集注意力,非MSA。**MiniMax稀疏注意力作为完整因果注意力运行,数值上精确(质量相等或更好),但长上下文速度更慢/需要更多KV缓存。MSA索引器权重已保留(bf16),供未来支持MSA的加载器使用。

这两点都是有意的:保留权重是为了使模型向前兼容,无需重新从源文件量化。

https://huggingface.co/thetom-ai/MiniMax-M3-ConfigI-MLX#what-is-config-i什么是Config-I?

Config-I是TurboQuant+中的一种张量角色感知权重压缩策略。通过系统的A/B隔离,发现注意力张量、FFN读投影(gate/up)、FFN写回投影(down)和边界层具有截然不同的压缩敏感性。关键洞察是:压缩策略比压缩算法更重要:即压缩哪些张量、保护哪些张量以及压缩的激进程度。对于MoE模型,专家MLP在参数数量上占主导地位,但由于每个token仅激活128个专家中的少数几个,因此它们能容忍激进的压缩;Config-I将它们压缩到2-3比特,同时保护注意力和路由。


此量化版本使用convert_m3.py (https://github.com/TheTom/turboquant_plus) 从MXFP8检查点生成。按原样分享,未经测试,供拥有相应硬件的人评估。

相似文章