@MiniMax_AI:介绍MiniMax M3:首个结合三大前沿能力的开源权重模型——编程与智能体前沿…
摘要
MiniMax发布了MiniMax M3,这是首个开源权重AI模型,集成了编码和智能体任务的前沿能力,通过稀疏注意力扩展到100万上下文,取得了强劲的基准分数。
介绍MiniMax M3:首个结合三大前沿能力的开放权重模型
- 编程与智能体前沿:59.0% SWE-Bench Pro,66.0% Terminal Bench 2.1,34.8% SWE-fficiency,28.8% KernelBench Hard,74.2% MCP Atlas
- MiniMax稀疏注意力将上下文扩展到1M
- https://t.co/TF891iJukF
查看缓存全文
缓存时间: 2026/06/01 05:30
介绍 MiniMax M3:首个融合三大前沿能力的开源权重模型
- 编码与智能体前沿:SWE-Bench Pro 达到 59.0%,Terminal Bench 2.1 达到 66.0%,SWE-fficiency 达到 34.8%,KernelBench Hard 达到 28.8%,MCP Atlas 达到 74.2%
- MiniMax 稀疏注意力 将上下文扩展至 100 万 token
- https://t.co/TF891iJukF
相似文章
Qwen3.8 27B 在 Artificial Analysis Agentic Index 上优于 Opus 5 Medium
Qwen3.8 27B 在 Artificial Analysis Agentic Index 上优于 Opus 5 Medium,凸显了其在代理任务中的强大能力。
Qwen3.8-27B在人工分析基准测试中与DeepSeek V4和GPT-5.6 Luna Max并驾齐驱。您现在只需一块RTX 3090就能运行一个接近前沿的模型。
Qwen3.8-27B是一款新AI模型,在人工分析基准测试中与DeepSeek V4和GPT-5.6 Luna Max等前沿模型性能相当,并且可以在RTX 3090 GPU上本地运行。
Ling 3.0 Tiny 是我低端 PC 上最强大、最快速、最出色的模型!
用户赞扬 Ling 3.0 Tiny AI 模型在低端 PC 上快速高效,并将其与 Qwen 3.5 9b 和 Gemma 12 等模型进行了有利的比较。
每美元智能是新的扩展定律:一个小型推理模型在Arc-AGI 1上突破现有成本-精度帕累托前沿
Chart Pathway的BDH-CQ,一个150M参数的推理模型,在ARC-AGI-1上达到了29.5%的准确率,每任务成本远低于像GPT-5.6 Luna这样的大型模型,展示了成本-精度权衡的改进。
Mimir:Vikings训练了一个1.7B的杀手级模型吗?
一个新的1.7B参数模型名为Mimir,声称在基准测试中优于Qwen 3.5和Gemma 4 E2B,在数学和编码方面具有优势,并基于Sapient的HRM-text架构。