@MTSlive: 情况说明:前沿模型70%的查询可在本地免费运行。@ClementDelangue,联合创始人兼首席执行官…
摘要
Hugging Face的Clement Delangue解释称,像ChatGPT这样的前沿模型,70%的查询可在本地免费处理,并认为将查询路由到专门的模型,会把价值从大型模型重新分配给更小、更高效的长尾模型。
查看缓存全文
缓存时间: 2026/06/28 22:08
情况说明:70%的前沿模型查询可在本地免费运行。
@ClementDelangue,@huggingface 联合创始人兼CEO:
“去年斯坦福大学发表了一项有趣的研究,表明人们向ChatGPT提出的问题中,有70%可以在你笔记本电脑上本地准确回答。完全免费。”
“如今人们用前沿模型处理的大部分AI工作负载,其实都可以用更便宜、更快、更可定制、更可控的模型来完成。但他们没有这样做,坦率说是因为挑选合适模型太麻烦了。”
“你被补贴着,所以不用操心——因为你有订阅,就把所有问题都丢给爱因斯坦。‘嘿爱因斯坦,今天天气怎么样?’”
“在现实生活中,他会说’我才不回答你这种蠢问题’。但因为这是AI,而且被AI实验室补贴着,所有问题都流向爱因斯坦——而在理想情况下,你应该有不同领域的专用模型,它们更擅长回答特定问题。”
“路由机制可能会将大量价值从前沿模型重新分配到更长的模型长尾中。这就像AI正在成熟…我们现在处于第一阶段,非常简单,人人都只用一个大模型。现在我们正在进入第二阶段。”
相似文章
@ClementDelangue: 来自@斯坦福的一项研究显示,71.3%的ChatGPT查询可以由本地模型准确回答。我怀疑……
Clement Delangue宣布了一项新的Hugging Face功能,可以根据本地硬件筛选AI模型。他引用斯坦福大学的一项研究,称大多数ChatGPT查询可以在本地得到准确回答,从而节省成本并增强所有权。
@ClementDelangue: 叙事矛盾:根据@Stanford的研究,本地模型能够准确回答71.3%的真实世界聊天和推理问题…
斯坦福大学研究表明,本地模型现在能准确回答71.3%的真实世界查询,而2023年仅为23.2%,这表明大多数任务不需要前沿模型,未来将是多模型模式,多数工作负载由本地、开源模型承担。
现在运行本地模型已经很不错了
作者报告说,运行本地AI模型如今已经表现出色,最近发布的GPT-OSS和Gemma 4等模型使得在本地进行自主编码的准确率达到了前沿模型的大约75%,与几个月前相比有了显著提升。
前沿模型是否正在成为不需要它们的任务的默认选择?
文章讨论了大多数AI流量由简单、可重复的任务组成,如分类和提取,然而前沿模型常常被用于所有事情。它质疑将任务路由到较小的专用模型是否会成为降低成本和延迟的标准做法。
Ask HN: 有没有人用本地模型替代 Claude/GPT 进行日常编码?
Hacker News 上的一场讨论探讨了开发者是否可以在日常编码中用本地模型替代像 Claude 这样的云端 AI 模型。参与者分享了经验,指出本地模型(例如 Qwen、Gemma)对爱好者来说可行,但在专业使用上仍落后于顶级云端模型。