我们在困难的智能体任务上测试了 DeepSeek v4 flash、GLM 5.2 和 Kimi K3,结果 DeepSeek 直接碾压

Reddit r/LocalLLaMA 新闻

摘要

Composio 在困难的智能体任务上测试了 DeepSeek v4 flash、GLM 5.2 和 Kimi K3,发现 DeepSeek 速度最快、成本最低,成功率与其他模型大致持平,而前沿模型仍稍稍领先。

https://preview.redd.it/uybjxyypj7hh1.png?width=1200&format=png&auto=webp&s=8293e8da332a14920b335caee52473762c09530d 作为我们内部评测报告的一部分,我们(@Composio)定期在一些最困难的智能体任务上测试模型。我们刚刚在新一轮内部评测中测试了开源权重模型的三巨头。 这些任务包括涉及多个应用(Pagerduty、Gmail、HubSpot、Airtable、Slack 等)的长时间运行工作流。每个任务由一组固定的确定性检查来评分,只有所有检查都通过才算通过。部分成功不计分。为了保持测试的公正性,我们使用 Pi Agent 作为测试框架,并搭配 Composio MCP 来访问所需的应用程序。 以下是我们发现的情况:完成任务所需时间 DeepSeek v4 flash,正如其名字所暗示的,是其中最快的。它每项任务耗时 164 秒,速度几乎是 GLM 的 2.5 倍,是 Kimi K3 的 1.4 倍。Kimi K3 虽然更大,但速度也快于 GLM 5.2。 我们还计算了每个模型完成每项任务的成本。由于输入 token 约占总花费的 95%,每项任务的平均成本为:DeepSeek:约 $0.08;GLM 5.2:约 $0.57;Kimi K3:约 $1.39。 尽管速度和价格差异巨大,成功率却几乎相同:DeepSeek:20/30;Kimi:21/30;GLM:21/30。 在同一组测试中,这三款模型都没有大幅落后于前沿模型:Fable 5 和 GPT-5.6 Sol 均获得 24/30,Opus 5 获得 23/30。 每款模型都有独特的工作风格:GLM 较慢但 token 用量省,DeepSeek 速度快但 token 用量大,Kimi 介于两者之间。每项任务的平均 token 数:GLM 5.2:409k;Kimi K3:462k;DeepSeek:569k。即便如此,DeepSeek 仍然是最快、最便宜的。 像 Fable 和 GPT 5.6 Sol 这样的顶尖模型,在需要额外“原始智商”的场景下仍然更好,但成本要高得多。 我们绝对预料到 Kimi 和 GLM 会表现出色。但 DeepSeek V4 flash 给了我们一个惊喜。鲸鱼兄弟们仍然在竞争之列。很想知道你们目前在智能体工作流中使用开源权重模型的体验。
查看原文

相似文章

Open source battle: GLM vs Kimi vs MiMo vs DeepSeek

Reddit r/LocalLLaMA

本文测试了智谱GLM 5.1、月之暗面Kimi K2.6、阶跃星辰MIMO 2.5 Pro和深度求索DeepSeek V4 Pro四个开源中国AI模型在编程任务中的表现,发现GLM在多数任务中整体领先但非绝对,各模型各有优劣。