不,本地模型不会赢

Lobsters Hottest 新闻

摘要

评论文章,认为本地 AI 模型永远不会赢,因为它们比数据中心推理更弱、更昂贵且效率更低,原因在于批处理和 GPU 优势。

<p><a href="https://lobste.rs/s/kkqqdn/no_local_models_will_not_win">评论</a></p>
查看原文
查看缓存全文

缓存时间: 2026/08/11 05:06

# 不,本地模型不会赢 来源:https://www.seangoedecke.com/local-models-will-not-win/ 每当有新开放权重 AI 模型发布时,就会有人说本地模型才是未来(https://news.ycombinator.com/item?id=49244353)。既然每个人都能在笔记本电脑或手机上运行 AI 模型,何必花数十亿美元建设数据中心?我认为这个想法注定失败。无论开放权重模型变得多强大,绝大多数推理将始终发生在 AI 数据中心。 ### 本地模型太弱,无法广泛使用 **本地模型永远不会那么强大。** 我认为这一点显而易见:当前所有前沿模型(无论是封闭还是开放权重)都太大了,除了数据中心中的完整 GPU 集群外,无法在任何设备上运行。当然,较小的模型会随着时间推移变得越来越智能。一年后,你可能能在笔记本电脑上运行一个和 GPT-5.6-Sol 差不多强的模型。但到那时,你会觉得 GPT-5.6-Sol 弱得没什么用。 许多人否认最后一点,但这是事实:**几乎所有人的显性偏好都是使用自己价格范围内最强大的模型**。如果 AI 进步在 GPT-4 时代停滞不前,我想我们本可以围绕它构建一些非常强大的工具,但今天谁会用 GPT-4 呢?随着 LLM 能力的提升,我们对它们的期望也在增长:我们现在期望智能体系统能够越来越独立地解决更多问题。当它们感到困惑或停滞不前时,会让人极其沮丧。如果有选择,人们会挑选那个让他们少受挫的模型——那总是更大、更强大的那个。 ### 本地模型更昂贵且效率更低 除此之外,**数据中心模型总是会更便宜**。我不明白为什么人们一直说本地模型便宜:在我看来,这和人们说开 Uber 是“白赚钱”(忽略了油费和汽车磨损成本)是同样的错误。仅低端家庭实验室的搭建费用(https://www.reddit.com/r/homelab/comments/1ngh9y5/comment/ne4i5xa/)1(https://www.seangoedecke.com/local-models-will-not-win/#fn-1)就够买好几年的 AI 提供商付费订阅。电费大约每月 50 到 300 美元,具体取决于你运行多少推理:这又是几份付费订阅的价格。 为什么数据中心模型更便宜?不是因为数据中心推理有补贴:推理实际上相当便宜(https://www.seangoedecke.com/ai-inference-is-obviously-profitable/)。如果你在本地和数据中心运行相同的模型,**数据中心模型本质上会更高效**。 主要原因是**批处理**。一块 GPU 执行数十万次数学运算的速度与执行一次完全相同。然而,对于单个用户的推理,每个新 token 都依赖于前一个 token 的结果,因此无法批处理2(https://www.seangoedecke.com/local-models-will-not-win/#fn-2)。可以批处理的是将数百名用户的推理合并在一起。这所花费的时间、电力和热量基本上与一次只为一个用户做推理一样。 当你在家运行自己的推理时,你没有任何东西可以批处理——最多也就是并行运行几个 AI 智能体——所以利用率非常糟糕。你付费购买了大量潜在推理能力却用不上,只能白白浪费。绕过这个问题的唯一方法是找一些朋友,把你的本地推理端点暴露给他们(到那时你基本上是在运行自己的蹩脚数据中心)。 另一个原因是**数据中心拥有更大、更高效的 GPU 可用**。你用来运行本地模型的那种消费级 GPU 是像 RTX 4090 这样的游戏 GPU。而专为批处理 AI 推理设计的数据中心 B200,在相同功耗下,FLOPS 约为其三倍,内存带宽接近其四倍3(https://www.seangoedecke.com/local-models-will-not-win/#fn-3)。所以综合批处理和 GPU 效率,你在本地运行模型所消耗的资源大约是 30 倍。 顺便说一句,这就是为什么我对那些说本地模型好的人持怀疑态度,他们说本地模型不像那些坏数据中心那样耗资源。如果你想高效运行 LLM,你应该尽可能地把自己的使用推入 AI 数据中心!客气地说,他们的意思是我们都应该运行*更小*的模型——但即便如此,理想情况下你也应该通过,比如说,GPT-5.6 Luna(https://developers.openai.com/api/docs/models/gpt-5.6-luna)API 来使用小模型,而不是自己托管模型。 ### 本地模型还有可能赢吗? 是否存在一个本地模型会赢的可能世界?我想是有的。可能发生的一件事是,政府可能完全禁止使用 AI 数据中心:要么出于对 AI 危险性的担忧,要么只是屈从于公众压力(https://www.npr.org/2026/08/08/g-s1-137853/data-centers-primaries-midterms)。在那个世界里,本地模型就是唯一的选择。 或者,AI 的进步可能会在大型模型上停滞不前,而小型模型继续进步。我很难想象这种情况会如何发生(除非像上面那样有政府干预),但一个 30B 参数模型能成为前沿模型的世界,就是一个本地模型可能具有竞争力的世界。 或者也许模型会变得*如此*之好,以至于一个 30B 模型真的聪明到能做所有事情,所以除非有人试图解决黎曼猜想,否则没人真的需要像 Opus 或 Sol 这样的模型。我并不真的相信这一点。今天的模型已经能从事前沿数学工作,但还没有聪明到能像我一样重构大型代码库,所以很难想象一个我不想使用最聪明可用模型的世界。 ### 本地模型并非无用 我确实认为本地模型总会有一个利基市场。我想起了 Thinking Machines 的“交互模型”(https://www.seangoedecke.com/interaction-models/)(OpenAI 也这么做(https://openai.com/index/introducing-gpt-live/),因为这很明显):对于语音聊天等对延迟敏感的应用,你让一个小而快的模型负责对话,它再把困难的思考委托给一个大而慢的模型。五年后大多数 AI 使用都通过手机或笔记本电脑上的本地模型来进行,我也不会感到惊讶(尽管在这个世界里,几乎所有工作仍然由 AI 数据中心完成)。 有些用户会偏好本地模型,即使它们更弱、更贵。例如,能够在本地引导(steer)模型(https://www.seangoedecke.com/steering-vectors/)对这类用户来说可能是一个杀手级功能。其他人可能只是重视对自己基础设施的完全控制,或者网络连接不可靠4(https://www.seangoedecke.com/local-models-will-not-win/#fn-4)。如果你是这类人——尤其是如果你只和模型聊天,而不是用它们做研究或编程——本地模型对你来说是个好选择。然而,我认为这始终会是一个小众群体。大多数用户将继续通过数据中心进行推理。 以下是一篇与此文章共享标签的相关文章预览。

相似文章

专注打磨,推动本地模型

Armin Ronacher

本文批评了当前用于编程助手的本地AI模型现状,认为虽然可运行性有所改善,但由于缺少工具参数流式传输等功能以及推理引擎间的过度碎片化,用户体验大打折扣,远不如使用托管API那般精致。

2026年中本地模型

Reddit r/LocalLLaMA

2026年中本地AI模型的技术概览,重点介绍开放权重模型如何通过混合专家模型和稀疏注意力机制的进步缩小了与前沿模型的差距,从而实现高效的本地推理。