使用五款中文编码大模型一个月后,M3真的会登顶吗?

Reddit r/ArtificialInteligence 新闻

摘要

一位用户分享了一个月内在TypeScript/Next.js代码库上对五款中文编码大模型(Kimi K2.6、GLM-5.1、MiMo V2.5 Pro、MiniMax 2.7、DeepSeek V4 Pro)的比较,从前端、后端、代码审查、全能型和推理等类别进行评分。他们指出MiniMax 2.7以约7%的成本实现了Opus 4.6约90%的质量,并推测即将推出的MiniMax 3.0是否会弥补规划和测试覆盖方面的不足,从而登上榜首。

过去4-5周,我一直在TS/Next代码库上轮流使用五款中文编码模型:Kimi K2.6、GLM-5.1、MiMo V2.5 Pro、MiniMax 2.7、DeepSeek V4 Pro。想分享一下我的结论,并询问M3的情况。快速分类评价如下: * 前端/设计 → K2.6 * 后端 → K2.6 和 GLM-5.1 * 代码审查 → MiMo * 全能型 → M2.7 * 重推理 → DeepSeek 后来我发现llmdevguy几周前在X上发布了几乎完全相同的排名(16.2万次浏览,2300赞),并以“现在我在等MiniMax 3.0登顶”结尾。很奇怪竟然得出完全一致的结论。 https://preview.redd.it/01k9njcpmo2h1.png?width=1190&format=png&auto=webp&s=ef920c65d32a34f1dc054718813d3bb57b54037e M2.7没有赢得任何一个单项。让我惊讶的是成本。Kilo Code在ClaudeAI上发布了一个基准测试:M2.7以约7%的成本达到了Opus 4.6约90%的质量(三个编码任务中0.27美元对3.67美元)。我自己的测试不科学,但比例相符。简而言之,不足在于测试覆盖较薄,并且它直接跳到代码而不做推理。所以我在更强模型规划后,把它当作执行者,而不是规划者。真正的问题是M3能否缩小规划和测试覆盖的差距。如果能,全能型很快就会成为每个类别的顶尖。有人在做并排测试吗?这在Python/Go/Rust上是否成立,还是只适用于TS?
查看原文

相似文章

我在 MacBook Air M5 上对 21 款本地大模型进行了代码质量与速度的性能评测

Reddit r/LocalLLaMA

一位开发者在 MacBook Air M5 上使用 HumanEval+ 对 21 款本地大模型进行了基准测试,发现 Qwen 3.6 35B-A3B (MoE) 以 89.6% 的得分和 16.9 tok/s 的速度位居榜首,而 Qwen 2.5 Coder 7B 仅需 4.5 GB 内存即可达到 84.2% 的性能,拥有最佳的内存性价比。值得注意的是,Gemma 4 系列的表现远低于预期(31B 版本仅得 31.1%),这可能是受 Q4_K_M 量化策略的影响。