我现在(主要)根据速度而非智能来挑选模型
摘要
作者认为前沿大语言模型已经达到了“足够好”的智能门槛,因此现在选择模型时更看重速度而非原始智能,并举例说像GLM5.2和DeepSeek V4 Flash这样快速的开源权重模型已成为日常主力。
<p><a href="https://lobste.rs/s/aso7dh/i_m_mostly_picking_models_on_speed_now_not">评论</a></p>
查看缓存全文
缓存时间: 2026/08/03 01:32
# 我现在(大部分)是根据速度选模型,而不是智能
Source: https://martinalderson.com/posts/speed-vs-intelligence/
这是我记忆中第一次,选择日常主力模型不再看原始智能,而是看速度。
## 我们是否已经到了智能的临界点?
这段话大概很快就会像变质的牛奶一样过时,但目前,大约 Opus 4.6 级别的模型对于我的大部分日常任务来说似乎已经“足够聪明”了——写代码、汇总研究资料、设计演示文稿,以及对着大量数据库做分析任务。
虽然我和大多数人一样,曾对 Fable 充满期待,但讽刺的是,美国政府停摆让大家有时间重新适应 Opus。当 Fable 在炒作热潮过后带着更多护栏回归时,我注意到的第一件事就是它有多*慢*[\[1\]](https://martinalderson.com/posts/speed-vs-intelligence/#fn1)。实际上慢到我很快就换回了 Opus。
我职业生涯中有很大一部分时间都在让软件变快。值得注意的是,当软件*快*的时候,交互体验会好很多。根据我的经验(以及许多研究),即使是最精美的产品,如果反应慢,你也不会喜欢用它。同样地,一个非常基础但速度超快的产品,用起来也会感觉很棒的实用主义。[\[2\]](https://martinalderson.com/posts/speed-vs-intelligence/#fn2)
在我看来,当只有少数又大又慢的模型能越过前面那个(假设的)智能门槛时,用慢模型并不划算。你省下来的速度,很快就会因为在它出错后不得不重做而浪费掉。
## 100tok/s 会成为新的 100ms 吗?
我此前写过 (https://martinalderson.com/posts/what-happens-when-coding-agents-stop-feeling-like-dialup/) 关于编码智能体慢得像拨号上网的感觉,那时前沿模型还在以 30-60tok/s 的速度爬行。这个变化比我预期的要快。
我记得的关键事实是,对人类来说,约 100ms 的感觉就是“即时”,这是黄金标准。我认为模型以 100tok/s 的速度输出,大约是我能跟上的最快速度。再快的话,输出就会快到我来不及(粗略)阅读。这并非一个精确的标准,因为现在模型的时间越来越多地花在推理上,而不是真正向你展示输出 token。而且它也因输出内容而有很大差异,散文每字符消耗的 token 远比代码少,所以你的实际体验可能会(也一定会)有所不同。
但大致来说,*对我来说* 100-200tok/s 已经感觉非常快了。低于 50tok/s 的输出会让人觉得越来越慢。讽刺的是,超过 200tok/s 反而让人有点不安——你可以在这里 (https://chatjimmy.ai/) 试试一个模型,速度高达 10,000tok/s+(!)。我相信随着我们习惯这种感觉,并让智能体做更复杂的工作,这个临界点会继续上移。
考虑到我认为有大量新模型已大致跨过上述门槛——比如 GLM5.2 和 DeepSeek V4 Flash GA——它们不仅开放权重,而且规模(更)小,我们现在有了广泛的模型和速度可选。如果你看看 OpenRouter 上 (https://openrouter.ai/z-ai/glm-5.2?tableSort=throughput&tableSortDir=desc#providers) 各家提供商对 GLM5.2 的速度排名,就能看到服务速度的惊人跨度——从最低不到 30tok/s 到最高的 129tok/s。
这是开放权重生态系统的又一大优势。虽然成本上的好处显而易见,但提供商也被激励在速度上进行这样的竞争,这一点非常有趣。[\[3\]](https://martinalderson.com/posts/speed-vs-intelligence/#fn3)
## 但也有局限
如果你熟悉帕累托法则 (https://en.wikipedia.org/wiki/Pareto_principle) 和阿姆达尔定律 (https://en.wikipedia.org/wiki/Amdahl%27s_law),你就会知道接下来要说什么。
假设“足够好”的模型会继续变得越来越快,那么速度上的收益将越来越多地被工具调用和我们人类的监督所消耗。
以一个使用 50tok/s 模型处理的智能体为例。大部分时间都花在等待推理返回上。现在让同一个回合以 250tok/s 运行,你会发现瓶颈越来越多地出现在你“本地”机器上的工具调用和你的决策上。
堆叠条形图比较了 50 tok/s 和 250 tok/s 下一个智能体回合的耗时。在 50 tok/s 时,一个回合耗时 65 秒——40 秒推理、15 秒工具调用、10 秒人工审查。在 250 tok/s 时耗时 33 秒——8 秒推理,工具调用仍为 15 秒,审查仍为 10 秒。模型速度快 5 倍,智能体却只快 2 倍。
> 数字很粗略,但规律是对的。模型 5 倍的加速只换来回合 2 倍的加速,因为另外 25 秒没有变。
而*更糟糕*的是,在加快本地机器处理这些工具调用方面,进展似乎停滞了,因为 AI 让硬件成本呈抛物线式飙升。这又是 AI 市场带来的一个奇异副作用。
所以我怀疑(至少目前是这样),对速度的需求在超过某个点之后会有一个上限。毫无疑问,有些场景需要大量推理(比如数学研究),这时加速推理是有用的。但我预计许多智能体会开始在本地/内部硬件、数据库调用和其他延迟环节上遇到瓶颈。
## 价格战即将到来
有意思的是,OpenAI 在 DeepSeek V4 Flash GA 发布前刚刚将其 Luna 变体的价格下调了 80%,使其作为一款前沿模型来说变得格外实惠。虽然相比 GLM5.2,我在用它获得优秀输出方面没那么好运,但我认为这表明市场这一端的定价将迎来一场彻底的厮杀。
你可以在 OpenRouter 上看到 GLM5.2 正在发生这种情况——各种折扣层出不穷,试图吸引客户。GLM5.2 的价格已经降到 $0.42/$1.32/MTok——只有 Opus 价格的*5%*。
OpenRouter 上 GLM 5.2 的提供商表格,显示了 StreamLake、NovitaAI、Decart、DeepInfra、百度千帆、CoreWeave、AkashML、GMICloud 和 Inceptron 的每百万 token 折扣价和吞吐量。
> 虽然最便宜的选择很慢,但多加一点点钱,你就能从 DeepInfra 获得 109tok/s 的速度。
随着下一代 GPU 在未来几个月内开始部署——包括 Nvidia 的 Vera Rubin 系列和 AMD 的 MI400 系列等——这些芯片中的新 HBM4 内存仅凭内存带宽就能带来 2 倍以上的输出 token 速度提升,再加上额外算力和互连带来的提升,效果会更好。
到 2027 年,我们很可能会有质量很好、价格合理、运行速度在 500tok/s+ 的模型。一整天盯着“仍在以极高强度思考”的日子可能终于要成为过去式了。
值得关注的是——我也拿不准该押注哪边——那些庞大的 2-3 万亿+参数模型在日常任务上是否真的会有*显著*更好的表现。一方面,感觉我们现在已经到了一个甜点区;另一方面,如果模型拥有一个数量级更高的智能,可能会让这个甜点区显得非常非常原始。
---
1. 其次当然是无休止的护栏触发,它们往往在最糟糕的时候出现——就在我深入一个困难任务、觉得自己正需要 Fable 提供的额外“火力”的时候。不过这就是另一个故事了。↩︎ (https://martinalderson.com/posts/speed-vs-intelligence/#fnref1)
2. 一个典型的例子是 Craigslist 或 Hacker News 这类网站。虽然它们看起来过时,但响应速度实在太快,你根本不会注意到。同样,你的“标准” SPA 应用为渲染一个首页要加载 30MB 的 React,大多数时候用起来像糖浆一样黏腻、像做杂务一样,尽管设计和产品上肯定花了大价钱。↩︎ (https://martinalderson.com/posts/speed-vs-intelligence/#fnref2)
3. 我知道 OpenAI 和 Anthropic 长期以来都提供模型的快速变体,但 API 定价高得吓人。除非你有无限预算,靠烧 token 刷基准测试,否则我没见过谁会日常使用它们。以合理价格提供超快且优秀的模型,是市场上最新出现的东西。↩︎ (https://martinalderson.com/posts/speed-vs-intelligence/#fnref3)
相似文章
@TheAhmadOsman: GLM 5.3 Flash 和 DeepSeek V4.1 Flash 对于 95% 的人来说已经足够了 顺便说一句,你不需要'前沿智能'……
一条由 TheAhmadOsman 发布的推文声称,诸如 GLM 5.3 Flash 和 DeepSeek V4.1 Flash 等 AI 模型对于大多数用户来说已经足够,因此不需要先进的'前沿智能'。
GLM-5.2 是 Artificial Analysis 上新的领先开源权重模型
智谱AI的GLM-5.2已成为Artificial Analysis Intelligence Index上新的领先开源权重模型,得分为51,超越了MiniMax-M3和DeepSeek V4 Pro等竞争对手。该模型拥有744B总参数、40B活跃参数、MIT许可证和1M上下文窗口。
超智能小型模型与超高效率大型模型之争
本文探讨了功能强大的本地化小型大语言模型与为效率优化的大型模型之间的争议,并通过MiniCPM5 2B和MoE Qwen3.6 35B在CPU上的运行表现进行对比分析。
@TheAhmadOsman: 规划 - GPT 5.6 Sol XHigh 实现 - GLM 5.3 Flash - DeepSeek V4.1 Flash 你不需要“前沿智能……
一条讨论在规划中使用各种AI模型(如GPT 5.6 Sol XHigh、GLM 5.3 Flash和DeepSeek V4.1 Flash)的推文,强调并非总是需要前沿智能。
GLM-5.2 (max) 目前是开源和专有模型中第三好的模型。
根据 Artificial Analysis 的 Intelligence Index,GLM-5.2 (max) 目前整体上排名第三,包含对智能性、开放性、成本和令牌使用量的详细分析。