@dealignai: MiniMax m3,专为 128GB Mac 打造。感谢 @hornsby_andrew 准备剪枝校准数据集并进行…
摘要
经过剪枝和量化的 MiniMax-M3 版本(MiniMax-M3-Medium-JANG_2L),针对使用 vMLX 在 128GB Mac 上运行进行了优化,采用 32% 专家剪枝和 JANG_2L 混合精度量化,使其占用空间约 105 GB。
查看缓存全文
缓存时间: 2026/06/18 10:12
MiniMax m3,专为128GB Mac打造
感谢@hornsby_andrew 准备剪枝校准数据集并进行了大量测试。
现在是难点——制作Swift运行时🥲
https://t.co/GIb5ejK9UU
JANGQ-AI/MiniMax-M3-Medium-JANG_2L · Hugging Face
来源:https://huggingface.co/JANGQ-AI/MiniMax-M3-Medium-JANG_2L
https://huggingface.co/JANGQ-AI/MiniMax-M3-Medium-JANG_2L#minimax-m3-%C2%B7-reap-32-%C2%B7-jang_2lMiniMax-M3 · REAP-32 · JANG_2L
https://huggingface.co/JANGQ-AI/MiniMax-M3-Medium-JANG_2L#%E2%9A%A0%EF%B8%8F-requires-vmlx-%E2%89%A5-v1562⚠️ 需要vMLX ≥ v1.5.62。早期vMLX版本存在运行时缓存错误,会导致长输出时出现重复循环。这是引擎问题,而非权重问题——**请将vMLX更新至v1.5.62或更高版本后再运行此模型。**在v1.5.62+版本上,生成内容清晰正常。
面向Apple Silicon的高效空间型MiniMax-M3(https://huggingface.co/MiniMaxAI)捆绑包:32% REAP专家剪枝 + JANG_2L混合精度量化,约105 GB,可通过vMLX(https://github.com/)/ MLX在单台128GB Mac上运行。
https://huggingface.co/JANGQ-AI/MiniMax-M3-Medium-JANG_2L#what-this-is这是什么
- **基础模型:**MiniMax-M3(
model_type=minimax_m3_vl)—— MoE、GQA-4、MSA Lightning索引器、视觉塔。 - **剪枝:**REAP显著性剪枝,**32%**的路由专家被移除(每MoE层保留128个中的87个),保留显著性最高的专家。
- **量化(JANG_2L,仿射,分组大小64):**张量位数:路由专家
gate_proj/up_proj:2位;路由专家down_proj:3位;共享专家:6位;稠密MLP(层0–2):6位;注意力 q/k/v/o:8位;嵌入:6位;lm_head:8位;视觉塔+投影器:8位;归一化层、路由门控、MSA索引器:fp16。down_proj保持3位(其余路由专家为2位),以保证长文本生成的稳定性。完整的每模块位图写入config.json(quantization字段),由加载器自动应用。
https://huggingface.co/JANGQ-AI/MiniMax-M3-Medium-JANG_2H#usage使用方法
在vMLX(v1.5.62+)中加载;引擎自动检测minimax_m3_vl并应用正确设置(原生MSA缓存、分页缓存关闭、每模块量化映射)。采样默认值已在generation_config.json中提供(temperature=1.0,top_p=0.95)。
https://huggingface.co/JANGQ-AI/MiniMax-M3-Medium-JANG_2L#attribution归属
- 量化与封装:Jinho Jang · [email protected]
- 基础模型 © MiniMax,按MiniMax-M3许可协议使用。
相似文章
JANGQ-AI/MiniMax-M2.7-JANGTQ_K : MiniMax M2.7 的混合位量化版本 - 磁盘占用 74 GB
发布了 MiniMax M2.7 模型的混合位量化版本,优化至 74 GB,以便在 Apple Silicon 设备上高效进行本地推理。
@no_stp_on_snek: MiniMax-M3 的 Config-I 量化版本已发布在 MLX 上。2-bit 专家、4-bit 注意力、8-bit 边界与嵌入、f16 路由器。约…
发布了 MiniMax-M3 的 Config-I 量化版本,在 MLX 上使用 2-bit 专家和 4-bit 注意力,将 427B MoE 模型从 869GB 减少到约 167GB,但该量化版本未经测试且需要为 mlx_lm 打补丁。
@TeksEdge: 随着MiniMax M3开源发布,以下是关于量化版本和模型大小的预期,包括所需VRAM:MiniMax M3 (428…
MiniMax M3是一款428B参数的MoE模型,活跃参数约23B,现已开源。它支持超长上下文(最高达1M)并提升了效率,提供了多种量化尺寸以及本地部署所需的VRAM要求。
@MiaAI_lab: 一个针对 vLLM 的 PR,允许 MiniMax M3 使用 TP=3。它的 NVFP4 量化版本大小为 260GB - lukealonso/MiniMax-M3-NVFP4 希望这能...
一个对 vLLM 的拉取请求为 MiniMax M3 增加了张量并行度 3 的支持(使用其 NVFP4 量化),使得该模型可以在 3 台 DGX Sparks(每台 87GB 显存)上运行。
@sdrzn: MiniMax的新m3模型在terminal-bench 2.1上得分与opus 4.7相同,计算/成本仅为前一代模…
MiniMax新推出的m3模型在terminal-bench 2.1上取得了与Opus 4.7相同的分数,但计算量和成本仅为原来的二十分之一,这归功于其全新的MiniMax Sparse Attention架构。