我在真实生产任务上测试了GLM-5.3、DeepSeek V4 Pro/Flash和Gemini 3.7 Flash。
摘要
本文对比了GLM-5.3、DeepSeek V4 Pro/Flash和Gemini 3.7 Flash在实际任务中的性能,建议使用Kimi K3处理复杂任务,DeepSeek V4 Flash用于日常任务,其他模型适用于网络安全等特定领域。
与网上看到的一次性演示不同,这种测试展示了模型在真实任务中实际表现如何:它遵循指令、尊重约束并保持专注的能力。GLM-5.3是一个良好且相当有能力的模型。其最大限制是缺乏多模态能力。在长时间运行的任务中,它有时会忘记部分指令,并不总是尊重所有约束。总体而言,它是低到中等复杂度任务的可靠选择。与Claude模型不同,它可以处理网络安全相关任务。但是——这一点很重要——平均而言,对于常规任务,它的表现并不比DeepSeek V4 Flash更好,而且生成速度也更慢。所以,个人认为,我主要将其保留用于安全审查和网络安全相关工作。DeepSeek V4 Pro是最大的失望。我不会说它比DeepSeek V4 Flash聪明得多。它倾向于忽略约束,并且经常开始做一些没人要求的事情。此外,它比Flash版本更贵。我不推荐它。DeepSeek V4 Flash速度极快,能力足够,而且非常便宜。在实际工作中,它并不明显弱于GLM-5.3或DeepSeek V4 Pro。你可以自信地将已分解的低到中等复杂度任务委托给它。Gemini 3.7 Flash也在同一时间左右发布。它更贵,而且我不觉得它比DeepSeek V4 Flash更聪明。使用它的主要原因是其多模态能力。也就是说,这些模型都不适合作为大型复杂任务的主要协调器。在这一角色上,Kimi K3对我来说仍然是领导者。它遵循指令、尊重约束、不忘记将工作委派给子代理,并且通常与原始计划保持一致。我目前的推荐是:Kimi K3 — 主要代理/协调器;DeepSeek V4 Flash — 工作主力;将已分解的任务交给它并监督执行;GLM-5.3 — 网络安全和安全审查任务;GPT-5.6-Luna / Gemini 3.7 Flash — 视觉分析。有了这样的组合,你可以从开始到结束处理真实世界任务,同时保持性能和成本的控制。
相似文章
我们在困难的智能体任务上测试了 DeepSeek v4 flash、GLM 5.2 和 Kimi K3,结果 DeepSeek 直接碾压
Composio 在困难的智能体任务上测试了 DeepSeek v4 flash、GLM 5.2 和 Kimi K3,发现 DeepSeek 速度最快、成本最低,成功率与其他模型大致持平,而前沿模型仍稍稍领先。
DeepSeek 0813 “Pro” vs GLM 5.2 和 Kimi K3 🐋
DeepSeek 0813 “Pro” 与 GLM 5.2 和 Kimi K3 的对比,可能涵盖这些 AI 模型的基准性能和能力差异。
Open source battle: GLM vs Kimi vs MiMo vs DeepSeek
本文测试了智谱GLM 5.1、月之暗面Kimi K2.6、阶跃星辰MIMO 2.5 Pro和深度求索DeepSeek V4 Pro四个开源中国AI模型在编程任务中的表现,发现GLM在多数任务中整体领先但非绝对,各模型各有优劣。
Gemini 3.5 Flash 基准测试
讨论了Gemini 3.5 Flash模型的基准测试结果,可能展示了它在各种AI任务上的表现。
新版DeepSeek V4-Flash在ArtificalAnalysis Index上取得50分,比GLM-5.2和GPT-5.6 Luna低1分
DeepSeek的新V4-Flash模型在ArtificalAnalysis Index上得分为50,仅比GLM-5.2和GPT-5.6 Luna低1分。