标签
Minimax-M3 模型的视觉支持已合并到 llama.cpp 项目,使得该模型可以在本地进行多模态推理。
支持MSA的Minimax M3模型已合并至llama.cpp,从而可以使用MSA架构对Minimax M3模型进行推理。
报告在8-16张MI50 GPU上运行的Minimax M3模型达到每秒19个token的峰值吞吐量。
开源权重模型已追赶上专有模型,GLM 5.2在浏览器代理任务中以低成本实现了接近Opus级别的得分。其他模型如Minimax M3和Kimi k2.7也显示出显著的改进。
经过剪枝和量化的 MiniMax-M3 版本(MiniMax-M3-Medium-JANG_2L),针对使用 vMLX 在 128GB Mac 上运行进行了优化,采用 32% 专家剪枝和 JANG_2L 混合精度量化,使其占用空间约 105 GB。
一位产品经理分享了在真实 Q3 战略简报上对 Minimax M3 的 1M 上下文窗口的实操测试,指出在约 20 万 token 以内来源归因很准确,但超过后综合能力下降。
使用Mac Studio上的MLX-VLM对开放权重MiniMax M3模型进行的测试表明,它能够从驾照照片和扫描文档中自动读取信息,并通过工具调用填写字段、复选框和签名,自主完成美国海关表格的填写。
Minimax-M3 被演示在 4 块 RTX Pro 6000 GPU 上运行,具备 800k 上下文,在 4 路并发下达到 70-120 tok/s 推理速度和 2000 tok/s 预填充速度,使用 376GB VRAM 和 mxfp4 格式。
对Kimi K2.6和Minimax M3在实际工作流中的亲测比较表明,M3成本约低5倍,而质量几乎相同,使其在生成式系统中更具成本效益。
Unsloth 正在将 MiniMax M3 模型的 GGUF 量化版本上传到 Hugging Face。
Unsloth 发布了 MiniMax-M3 多模态模型的 GGUF 量化版本,支持图像-文本到文本任务,兼容 Transformers、llama.cpp、vLLM 等推理引擎。
用户询问即将开源的 Minimax M3 模型在智能体任务和编程方面的表现,并想知道它与 GPT 5.2 等旧版 GPT 模型相比如何。
MiniMax 通过 API 发布了 M3,这是一款拥有 100 万 token 上下文窗口并支持原生多模态输入的模型。该公司承诺在 10 天内发布开源权重和技术报告。
MiniMax 宣布推出 MiniMax-M3,这是一款结合前沿编程和代理能力的开源权重模型,采用稀疏注意力机制扩展至 1M 上下文,计划于下周在 HuggingFace 上线。