Kimi K2.6 vs Minimax M3:成本高出5倍,结果反而更差?我做了测试。

Reddit r/AI_Agents 模型

摘要

对Kimi K2.6和Minimax M3在实际工作流中的亲测比较表明,M3成本约低5倍,而质量几乎相同,使其在生成式系统中更具成本效益。

过去48小时里,我比较了Kimi K2.6和Minimax M3在实际工作流中的表现。不是基准测试。是真实的终端编码、API调用、工具使用和多步骤流程。结果让我惊讶。M3解决了更多任务,质量几乎相同,成本却低得多。 **测试内容** * 10个最难的Terminal-Bench任务 * Gmail、Slack、GitHub、Drive、Calendar、Notion和Reddit工作流 * 相同的提示词 * 相同的工具 * 相同的沙盒环境 仅模型不同。 # 终端编码 |模型|解决任务数|成本| |:-|:-|:-| | | | |M3|5/10|$2.80| |K2.6|4/10|$6.61| K2.6成本大约高出2.4倍,解决的任务却更少。一个例子尤为突出:一个困难的路径追踪反向任务需要134次终端往返。M3坚持到最后完成了它,而K2.6超时了。 **实际工作流任务** 我运行了25个实用场景: * 邮件摘要 * Drive整理 * GitHub分析 * 初创公司调研 * 外联草稿 * 跨应用自动化 评分方式简单: * 1 = 成功完成 * 0 = 失败 * 所有任务的平均分 结果: |模型|分数|成本| |:-|:-|:-| | | | |M3|0.75|$0.81| |K2.6|0.72|$4.08| 质量差异微乎其微,成本差异却巨大。M3最终成本大约低5倍,结果几乎相同。 **为何重要** 大多数模型讨论都关注能力。而生产负载关注的是另一回事: * 每完成任务的成本 * 工具调用效率 * 重试率 * 上下文窗口 当前定价: **Minimax M3** * $0.30 / M输入token * $1.20 / M输出token * 1M上下文窗口 **Kimi K2.6** * $0.68 / M输入token * $3.41 / M输出token * 262k上下文窗口 一旦智能体开始进行数十次工具调用,输出成本就会变得比大多数基准图表所显示的更为重要。 **我的体会** 最大的惊喜不是M3赢了几项测试,而是我经常忘记自己用的不是高端模型。我会看着输出,以为两者差不多,然后查看账单才发现K2.6的成本高出数倍。 对于编码智能体、终端工作流和成本敏感的生产系统,我会优先部署M3。对于研究密集型工作流,K2.6仍然是一个强大的模型。但根据这些测试,每美元的价值差距并不接近。 还有人在同时运行这两个模型吗?你们在每完成任务的成本方面看到了什么?
查看原文

相似文章

测量从GPT-5.3-codex到Minimax M3的生产工作流切换

Reddit r/AI_Agents

一个生产团队将其QA智能体从GPT-5.3-codex迁移到MiniMax M3,发现虽然新模型每个任务使用更多token,但由于其更低的每token价格,中位成本降低了55%。文章还强调了推理提供商选择以及隐藏推理token对有效定价的影响。

Minimax M3 与 M2.7 对比

Reddit r/LocalLLaMA

讨论比较新款 Minimax M3 模型与其前代 M2.7,寻求发布两周后的用户反馈。