我们在困难的智能体任务上测试了 DeepSeek v4 flash、GLM 5.2 和 Kimi K3,结果 DeepSeek 直接碾压
摘要
Composio 在困难的智能体任务上测试了 DeepSeek v4 flash、GLM 5.2 和 Kimi K3,发现 DeepSeek 速度最快、成本最低,成功率与其他模型大致持平,而前沿模型仍稍稍领先。
https://preview.redd.it/uybjxyypj7hh1.png?width=1200&format=png&auto=webp&s=8293e8da332a14920b335caee52473762c09530d 作为我们内部评测报告的一部分,我们(@Composio)定期在一些最困难的智能体任务上测试模型。我们刚刚在新一轮内部评测中测试了开源权重模型的三巨头。
这些任务包括涉及多个应用(Pagerduty、Gmail、HubSpot、Airtable、Slack 等)的长时间运行工作流。每个任务由一组固定的确定性检查来评分,只有所有检查都通过才算通过。部分成功不计分。为了保持测试的公正性,我们使用 Pi Agent 作为测试框架,并搭配 Composio MCP 来访问所需的应用程序。
以下是我们发现的情况:完成任务所需时间 DeepSeek v4 flash,正如其名字所暗示的,是其中最快的。它每项任务耗时 164 秒,速度几乎是 GLM 的 2.5 倍,是 Kimi K3 的 1.4 倍。Kimi K3 虽然更大,但速度也快于 GLM 5.2。
我们还计算了每个模型完成每项任务的成本。由于输入 token 约占总花费的 95%,每项任务的平均成本为:DeepSeek:约 $0.08;GLM 5.2:约 $0.57;Kimi K3:约 $1.39。
尽管速度和价格差异巨大,成功率却几乎相同:DeepSeek:20/30;Kimi:21/30;GLM:21/30。
在同一组测试中,这三款模型都没有大幅落后于前沿模型:Fable 5 和 GPT-5.6 Sol 均获得 24/30,Opus 5 获得 23/30。
每款模型都有独特的工作风格:GLM 较慢但 token 用量省,DeepSeek 速度快但 token 用量大,Kimi 介于两者之间。每项任务的平均 token 数:GLM 5.2:409k;Kimi K3:462k;DeepSeek:569k。即便如此,DeepSeek 仍然是最快、最便宜的。
像 Fable 和 GPT 5.6 Sol 这样的顶尖模型,在需要额外“原始智商”的场景下仍然更好,但成本要高得多。
我们绝对预料到 Kimi 和 GLM 会表现出色。但 DeepSeek V4 flash 给了我们一个惊喜。鲸鱼兄弟们仍然在竞争之列。很想知道你们目前在智能体工作流中使用开源权重模型的体验。
相似文章
我们实测了DeepSeek V4 Pro和Flash与Claude Opus 4.7和Kimi K2.6的对比(11分钟阅读)
DeepSeek于2026年4月24日以MIT许可证发布了V4 Pro和V4 Flash。在与Claude Opus 4.7和Kimi K2.6的基准测试中,V4 Pro得分77/100,价格为2.25美元,性能介于Opus 4.7(91分)和Kimi K2.6(68分)之间;而V4 Flash得分60/100,价格为0.02美元,是本次对比中最便宜的,并且到5月31日前购买V4 Pro可享受75%的折扣。
Deepseek V4 Flash 现已成为仅次于 Kimi K3 的第二大开源权重模型,且成本低 50 倍以上
DeepSeek 的新 V4 Flash 模型据报道是仅次于 Kimi K3 的第二大开源权重模型,以超过 50 倍更低的成本(每 100 万 tokens 0.09/0.18 美元)提供强劲性能,并具备扎实的代码和推理能力。
Open source battle: GLM vs Kimi vs MiMo vs DeepSeek
本文测试了智谱GLM 5.1、月之暗面Kimi K2.6、阶跃星辰MIMO 2.5 Pro和深度求索DeepSeek V4 Pro四个开源中国AI模型在编程任务中的表现,发现GLM在多数任务中整体领先但非绝对,各模型各有优劣。
@0xSero:DeepSeek-V4-Pro 和 Kimi-K2.6 正在 Codex 应用中运行。体验前沿技术最经济的方式。支持本地模型,并且它们可以……
Codex 应用现已支持 DeepSeek-V4-Pro 和 Kimi-K2.6,提供使用前沿 AI 模型的最经济方式,同时支持本地模型和计算机使用功能。
新版DeepSeek V4-Flash在ArtificalAnalysis Index上取得50分,比GLM-5.2和GPT-5.6 Luna低1分
DeepSeek的新V4-Flash模型在ArtificalAnalysis Index上得分为50,仅比GLM-5.2和GPT-5.6 Luna低1分。