我在真实生产任务上测试了GLM-5.3、DeepSeek V4 Pro/Flash和Gemini 3.7 Flash。

Reddit r/ArtificialInteligence 新闻

摘要

本文对比了GLM-5.3、DeepSeek V4 Pro/Flash和Gemini 3.7 Flash在实际任务中的性能,建议使用Kimi K3处理复杂任务,DeepSeek V4 Flash用于日常任务,其他模型适用于网络安全等特定领域。

与网上看到的一次性演示不同,这种测试展示了模型在真实任务中实际表现如何:它遵循指令、尊重约束并保持专注的能力。GLM-5.3是一个良好且相当有能力的模型。其最大限制是缺乏多模态能力。在长时间运行的任务中,它有时会忘记部分指令,并不总是尊重所有约束。总体而言,它是低到中等复杂度任务的可靠选择。与Claude模型不同,它可以处理网络安全相关任务。但是——这一点很重要——平均而言,对于常规任务,它的表现并不比DeepSeek V4 Flash更好,而且生成速度也更慢。所以,个人认为,我主要将其保留用于安全审查和网络安全相关工作。DeepSeek V4 Pro是最大的失望。我不会说它比DeepSeek V4 Flash聪明得多。它倾向于忽略约束,并且经常开始做一些没人要求的事情。此外,它比Flash版本更贵。我不推荐它。DeepSeek V4 Flash速度极快,能力足够,而且非常便宜。在实际工作中,它并不明显弱于GLM-5.3或DeepSeek V4 Pro。你可以自信地将已分解的低到中等复杂度任务委托给它。Gemini 3.7 Flash也在同一时间左右发布。它更贵,而且我不觉得它比DeepSeek V4 Flash更聪明。使用它的主要原因是其多模态能力。也就是说,这些模型都不适合作为大型复杂任务的主要协调器。在这一角色上,Kimi K3对我来说仍然是领导者。它遵循指令、尊重约束、不忘记将工作委派给子代理,并且通常与原始计划保持一致。我目前的推荐是:Kimi K3 — 主要代理/协调器;DeepSeek V4 Flash — 工作主力;将已分解的任务交给它并监督执行;GLM-5.3 — 网络安全和安全审查任务;GPT-5.6-Luna / Gemini 3.7 Flash — 视觉分析。有了这样的组合,你可以从开始到结束处理真实世界任务,同时保持性能和成本的控制。
查看原文

相似文章

Open source battle: GLM vs Kimi vs MiMo vs DeepSeek

Reddit r/LocalLLaMA

本文测试了智谱GLM 5.1、月之暗面Kimi K2.6、阶跃星辰MIMO 2.5 Pro和深度求索DeepSeek V4 Pro四个开源中国AI模型在编程任务中的表现,发现GLM在多数任务中整体领先但非绝对,各模型各有优劣。

Gemini 3.5 Flash 基准测试

Reddit r/singularity

讨论了Gemini 3.5 Flash模型的基准测试结果,可能展示了它在各种AI任务上的表现。