@dealignai: MiniMax m3,专为 128GB Mac 打造。感谢 @hornsby_andrew 准备剪枝校准数据集并进行…

X AI KOLs Timeline 模型

摘要

经过剪枝和量化的 MiniMax-M3 版本(MiniMax-M3-Medium-JANG_2L),针对使用 vMLX 在 128GB Mac 上运行进行了优化,采用 32% 专家剪枝和 JANG_2L 混合精度量化,使其占用空间约 105 GB。

MiniMax m3,专为 128GB Mac 打造 感谢 @hornsby_andrew 准备剪枝校准数据集并进行大量测试。 现在到了最困难的部分:编写 Swift 运行时 🥲 https://t.co/GIb5ejK9UU
查看原文
查看缓存全文

缓存时间: 2026/06/18 10:12

MiniMax m3,专为128GB Mac打造

感谢@hornsby_andrew 准备剪枝校准数据集并进行了大量测试。

现在是难点——制作Swift运行时🥲

https://t.co/GIb5ejK9UU


JANGQ-AI/MiniMax-M3-Medium-JANG_2L · Hugging Face

来源:https://huggingface.co/JANGQ-AI/MiniMax-M3-Medium-JANG_2L

https://huggingface.co/JANGQ-AI/MiniMax-M3-Medium-JANG_2L#minimax-m3-%C2%B7-reap-32-%C2%B7-jang_2lMiniMax-M3 · REAP-32 · JANG_2L

https://huggingface.co/JANGQ-AI/MiniMax-M3-Medium-JANG_2L#%E2%9A%A0%EF%B8%8F-requires-vmlx-%E2%89%A5-v1562⚠️ 需要vMLX ≥ v1.5.62。早期vMLX版本存在运行时缓存错误,会导致长输出时出现重复循环。这是引擎问题,而非权重问题——**请将vMLX更新至v1.5.62或更高版本后再运行此模型。**在v1.5.62+版本上,生成内容清晰正常。

面向Apple Silicon的高效空间型MiniMax-M3(https://huggingface.co/MiniMaxAI)捆绑包:32% REAP专家剪枝 + JANG_2L混合精度量化,约105 GB,可通过vMLX(https://github.com/)/ MLX在单台128GB Mac上运行。

https://huggingface.co/JANGQ-AI/MiniMax-M3-Medium-JANG_2L#what-this-is这是什么

  • **基础模型:**MiniMax-M3(model_type=minimax_m3_vl)—— MoE、GQA-4、MSA Lightning索引器、视觉塔。
  • **剪枝:**REAP显著性剪枝,**32%**的路由专家被移除(每MoE层保留128个中的87个),保留显著性最高的专家。
  • **量化(JANG_2L,仿射,分组大小64):**张量位数:路由专家 gate_proj/up_proj:2位;路由专家 down_proj3位;共享专家:6位;稠密MLP(层0–2):6位;注意力 q/k/v/o:8位;嵌入:6位;lm_head:8位;视觉塔+投影器:8位;归一化层、路由门控、MSA索引器:fp16。down_proj保持3位(其余路由专家为2位),以保证长文本生成的稳定性。完整的每模块位图写入config.jsonquantization字段),由加载器自动应用。

https://huggingface.co/JANGQ-AI/MiniMax-M3-Medium-JANG_2H#usage使用方法

在vMLX(v1.5.62+)中加载;引擎自动检测minimax_m3_vl并应用正确设置(原生MSA缓存、分页缓存关闭、每模块量化映射)。采样默认值已在generation_config.json中提供(temperature=1.0top_p=0.95)。

https://huggingface.co/JANGQ-AI/MiniMax-M3-Medium-JANG_2L#attribution归属

  • 量化与封装:Jinho Jang · [email protected]
  • 基础模型 © MiniMax,按MiniMax-M3许可协议使用。

相似文章