JANGQ-AI/MiniMax-M2.7-JANGTQ_K : MiniMax M2.7 的混合位量化版本 - 磁盘占用 74 GB
摘要
发布了 MiniMax M2.7 模型的混合位量化版本,优化至 74 GB,以便在 Apple Silicon 设备上高效进行本地推理。
查看缓存全文
缓存时间: 2026/05/08 10:10
JANGQ-AI/MiniMax-M2.7-JANGTQ_K · Hugging Face 来源: https://huggingface.co/JANGQ-AI/MiniMax-M2.7-JANGTQ_K
MiniMax M2.7 — 磁盘占用 74 GB(从原始 FP8 格式约 230 GB 缩减)——采用 JANGTQ-PRESTACK 布局的混合比特 JANGTQ_K 量化。
- 来源模型: MiniMaxAI/MiniMax-M2.7 (https://huggingface.co/MiniMaxAI)(62 层,256 个路由专家,top-8 激活,196K 上下文)
- 量化方式: 路由专家采用混合比特 MXTQ:
down_proj:4 比特(输出进入残差流,更敏感)gate_proj:2 比特(门控激活,敏感度较低)up_proj:2 比特(门控激活)- 注意力 / 共享专家 / 嵌入层 / lm_head:8 比特仿射量化
- 归一化层 / 路由器门控 / expert_bias:FP16 / FP32 直通
- 路由专家布局: 按照 JANGTQ-PRESTACK 标准沿轴 0 预堆叠 — 即刻冷加载,无需运行时侧边模块。
- 打包大小: 磁盘占用约 74 GB(路由专家平均约 3 比特)
- 运行设备: M3 Max 96 GB+ / M4 Max 128 GB / M5 Max 128 GB / Mac Studio
https://huggingface.co/JANGQ-AI/MiniMax-M2.7-JANGTQ_K#why-mixed-bit
为什么采用混合比特?
down_proj 的输出进入残差流,并跨 62 层累积 — 量化噪声会叠加。而 gate_proj 和 up_proj 通过 SwiGLU 的乘法门(silu(gate) × up)进入,该门会抑制噪声。在 down 上花费 4 比特、gate/up 上花费 2 比特,可获得接近全 4 比特(约 115 GB)的质量,但体积仅为 64%。
https://huggingface.co/JANGQ-AI/MiniMax-M2.7-JANGTQ_K#variants-in-the-minimax-m27-line
MiniMax-M2.7 系列的各变体
| 变体 | 路由比特(平均) | 打包大小 | 适用场景 |
|---|---|---|---|
MiniMax-M2.7-JANGTQ | 2 比特 | 47 GB | 最小体积,适合内存紧张的环境 |
MiniMax-M2.7-JANGTQ_K(本模型) | 约 3 比特(混合 2/4) | 74 GB | 质量接近 4 比特,体积与 2 比特相当 |
https://huggingface.co/JANGQ-AI/MiniMax-M2.7-JANGTQ_K#loading
加载方式
pip install jang-tools mlx-lm
from jang_tools.load_jangtq import load_jangtq_model
model, tokenizer = load_jangtq_model("JANGQ-AI/MiniMax-M2.7-JANGTQ_K")
https://huggingface.co/JANGQ-AI/MiniMax-M2.7-JANGTQ_K#reasoning–tools
推理 + 工具
- 默认设置: 开启思考(聊天模板在助手前缀后插入
\n) - 禁用推理:
messages = [{"role": "user", "content": "..."}] inp = tokenizer.apply_chat_template(messages, add_generation_prompt=True, enable_thinking=False) - 推理解析器:
qwen3(提取...块) - 工具解析器:
minimax
聊天模板已正确配置 enable_thinking 开关,既以独立的 chat_template.jinja 形式存在,也内联在 tokenizer_config.json["chat_template"] 中,供支持内联读取的引擎(如 vMLX、Swift swift-transformers)使用。
https://huggingface.co/JANGQ-AI/MiniMax-M2.7-JANGTQ_K#credits
致谢
- 量化 + MLX 运行环境: Jinho Jang([email protected])
- 基础模型: MiniMaxAI — M2.7 架构
相似文章
@dealignai: MiniMax m3,专为 128GB Mac 打造。感谢 @hornsby_andrew 准备剪枝校准数据集并进行…
经过剪枝和量化的 MiniMax-M3 版本(MiniMax-M3-Medium-JANG_2L),针对使用 vMLX 在 128GB Mac 上运行进行了优化,采用 32% 专家剪枝和 JANG_2L 混合精度量化,使其占用空间约 105 GB。
@no_stp_on_snek: MiniMax-M3 的 Config-I 量化版本已发布在 MLX 上。2-bit 专家、4-bit 注意力、8-bit 边界与嵌入、f16 路由器。约…
发布了 MiniMax-M3 的 Config-I 量化版本,在 MLX 上使用 2-bit 专家和 4-bit 注意力,将 427B MoE 模型从 869GB 减少到约 167GB,但该量化版本未经测试且需要为 mlx_lm 打补丁。
@TeksEdge: 随着MiniMax M3开源发布,以下是关于量化版本和模型大小的预期,包括所需VRAM:MiniMax M3 (428…
MiniMax M3是一款428B参数的MoE模型,活跃参数约23B,现已开源。它支持超长上下文(最高达1M)并提升了效率,提供了多种量化尺寸以及本地部署所需的VRAM要求。
@stevibe:MiniMax M2.7 有 230B 参数,家里真能跑?我用 Unsloth 的 UD-IQ3_XXS(80 GB)在 4 套配置上实测:…
MiniMax M2.7 有 230B 参数,家里真能跑?我用 Unsloth 的 UD-IQ3_XXS(80 GB)在 4 套配置上实测:4×RTX 4090(96 GB):71.52 tok/s,首 token 延迟 1045 ms;4×RTX 5090(128 GB):120.54 tok/s,首 token 延迟 725 ms;1×RTX PRO 6000(96 GB):118.74 tok/s,首 token 延迟 765 ms;DGX
Qwen3.8-27B 混合 IQ4_XS 量化版本,适用于16GB RAM
这是一个使用 IQ4_XS 量化的 Qwen3.8-27B AI模型的量化版本,针对16GB RAM系统进行了优化,并提供使用各种工具如 llama.cpp 和 Ollama 的本地部署指南。