JANGQ-AI/MiniMax-M2.7-JANGTQ_K : MiniMax M2.7 的混合位量化版本 - 磁盘占用 74 GB

Reddit r/LocalLLaMA 模型

摘要

发布了 MiniMax M2.7 模型的混合位量化版本,优化至 74 GB,以便在 Apple Silicon 设备上高效进行本地推理。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/05/08 10:10

JANGQ-AI/MiniMax-M2.7-JANGTQ_K · Hugging Face 来源: https://huggingface.co/JANGQ-AI/MiniMax-M2.7-JANGTQ_K

MiniMax M2.7 — 磁盘占用 74 GB(从原始 FP8 格式约 230 GB 缩减)——采用 JANGTQ-PRESTACK 布局的混合比特 JANGTQ_K 量化。

  • 来源模型: MiniMaxAI/MiniMax-M2.7 (https://huggingface.co/MiniMaxAI)(62 层,256 个路由专家,top-8 激活,196K 上下文)
  • 量化方式: 路由专家采用混合比特 MXTQ:
    • down_proj:4 比特(输出进入残差流,更敏感)
    • gate_proj:2 比特(门控激活,敏感度较低)
    • up_proj:2 比特(门控激活)
    • 注意力 / 共享专家 / 嵌入层 / lm_head:8 比特仿射量化
    • 归一化层 / 路由器门控 / expert_bias:FP16 / FP32 直通
  • 路由专家布局: 按照 JANGTQ-PRESTACK 标准沿轴 0 预堆叠 — 即刻冷加载,无需运行时侧边模块。
  • 打包大小: 磁盘占用约 74 GB(路由专家平均约 3 比特)
  • 运行设备: M3 Max 96 GB+ / M4 Max 128 GB / M5 Max 128 GB / Mac Studio

https://huggingface.co/JANGQ-AI/MiniMax-M2.7-JANGTQ_K#why-mixed-bit

为什么采用混合比特?
down_proj 的输出进入残差流,并跨 62 层累积 — 量化噪声会叠加。而 gate_proj 和 up_proj 通过 SwiGLU 的乘法门(silu(gate) × up)进入,该门会抑制噪声。在 down 上花费 4 比特、gate/up 上花费 2 比特,可获得接近全 4 比特(约 115 GB)的质量,但体积仅为 64%。

https://huggingface.co/JANGQ-AI/MiniMax-M2.7-JANGTQ_K#variants-in-the-minimax-m27-line

MiniMax-M2.7 系列的各变体

变体路由比特(平均)打包大小适用场景
MiniMax-M2.7-JANGTQ2 比特47 GB最小体积,适合内存紧张的环境
MiniMax-M2.7-JANGTQ_K(本模型)约 3 比特(混合 2/4)74 GB质量接近 4 比特,体积与 2 比特相当

https://huggingface.co/JANGQ-AI/MiniMax-M2.7-JANGTQ_K#loading

加载方式

pip install jang-tools mlx-lm
from jang_tools.load_jangtq import load_jangtq_model
model, tokenizer = load_jangtq_model("JANGQ-AI/MiniMax-M2.7-JANGTQ_K")

https://huggingface.co/JANGQ-AI/MiniMax-M2.7-JANGTQ_K#reasoning–tools

推理 + 工具

  • 默认设置: 开启思考(聊天模板在助手前缀后插入 \n)
  • 禁用推理:
    messages = [{"role": "user", "content": "..."}]
    inp = tokenizer.apply_chat_template(messages, add_generation_prompt=True, enable_thinking=False)
    
  • 推理解析器: qwen3(提取 ... 块)
  • 工具解析器: minimax

聊天模板已正确配置 enable_thinking 开关,既以独立的 chat_template.jinja 形式存在,也内联在 tokenizer_config.json["chat_template"] 中,供支持内联读取的引擎(如 vMLX、Swift swift-transformers)使用。

https://huggingface.co/JANGQ-AI/MiniMax-M2.7-JANGTQ_K#credits

致谢

  • 量化 + MLX 运行环境: Jinho Jang([email protected])
  • 基础模型: MiniMaxAI — M2.7 架构

相似文章