Kimi K2.6 vs Minimax M3:成本高出5倍,结果反而更差?我做了测试。
摘要
对Kimi K2.6和Minimax M3在实际工作流中的亲测比较表明,M3成本约低5倍,而质量几乎相同,使其在生成式系统中更具成本效益。
过去48小时里,我比较了Kimi K2.6和Minimax M3在实际工作流中的表现。不是基准测试。是真实的终端编码、API调用、工具使用和多步骤流程。结果让我惊讶。M3解决了更多任务,质量几乎相同,成本却低得多。
**测试内容**
* 10个最难的Terminal-Bench任务
* Gmail、Slack、GitHub、Drive、Calendar、Notion和Reddit工作流
* 相同的提示词
* 相同的工具
* 相同的沙盒环境
仅模型不同。
# 终端编码
|模型|解决任务数|成本|
|:-|:-|:-|
| | |
|M3|5/10|$2.80|
|K2.6|4/10|$6.61|
K2.6成本大约高出2.4倍,解决的任务却更少。一个例子尤为突出:一个困难的路径追踪反向任务需要134次终端往返。M3坚持到最后完成了它,而K2.6超时了。
**实际工作流任务**
我运行了25个实用场景:
* 邮件摘要
* Drive整理
* GitHub分析
* 初创公司调研
* 外联草稿
* 跨应用自动化
评分方式简单:
* 1 = 成功完成
* 0 = 失败
* 所有任务的平均分
结果:
|模型|分数|成本|
|:-|:-|:-|
| | |
|M3|0.75|$0.81|
|K2.6|0.72|$4.08|
质量差异微乎其微,成本差异却巨大。M3最终成本大约低5倍,结果几乎相同。
**为何重要**
大多数模型讨论都关注能力。而生产负载关注的是另一回事:
* 每完成任务的成本
* 工具调用效率
* 重试率
* 上下文窗口
当前定价:
**Minimax M3**
* $0.30 / M输入token
* $1.20 / M输出token
* 1M上下文窗口
**Kimi K2.6**
* $0.68 / M输入token
* $3.41 / M输出token
* 262k上下文窗口
一旦智能体开始进行数十次工具调用,输出成本就会变得比大多数基准图表所显示的更为重要。
**我的体会**
最大的惊喜不是M3赢了几项测试,而是我经常忘记自己用的不是高端模型。我会看着输出,以为两者差不多,然后查看账单才发现K2.6的成本高出数倍。
对于编码智能体、终端工作流和成本敏感的生产系统,我会优先部署M3。对于研究密集型工作流,K2.6仍然是一个强大的模型。但根据这些测试,每美元的价值差距并不接近。
还有人在同时运行这两个模型吗?你们在每完成任务的成本方面看到了什么?
相似文章
MineBench上Kimi K2.5与Kimi K2.6的差异
在MineBench的3D Minecraft结构任务中,Kimi K2.6相比K2.5质量提升显著,同时每次运行仅2.35美元,性价比极高。
测量从GPT-5.3-codex到Minimax M3的生产工作流切换
一个生产团队将其QA智能体从GPT-5.3-codex迁移到MiniMax M3,发现虽然新模型每个任务使用更多token,但由于其更低的每token价格,中位成本降低了55%。文章还强调了推理提供商选择以及隐藏推理token对有效定价的影响。
@0x0SojalSec: Kimi K3 推动端到端知识工作的进展。除了公共基准测试,Kimi K3 (max) 也…
Kimi K3 在端到端知识工作中表现出持续的改进,公共基准测试和内部评审均证明了这一点,表明其智能体能力得到了增强。
Kimi K2.6 Agent 是否比 Claude Code/Claude Co-work 更好?
本文比较了 Kimi K2.6 Agent 与 Claude Code 和 Claude Co-work,评估哪个更适合编程任务。
Minimax M3 与 M2.7 对比
讨论比较新款 Minimax M3 模型与其前代 M2.7,寻求发布两周后的用户反馈。