小型模型已至
摘要
本文讨论了像GPT-5.6-luna和GLM 5.3这样的小型且经济高效的AI模型如何变得既强大又实惠,降低推理成本,为消费和商业AI应用开启新可能。
暂无内容
查看缓存全文
缓存时间: 2026/08/27 18:21
# 小模型已至
来源:https://calv.info/small-models-have-arrived
过去几周,我一直在体验 gpt-5.6-luna(https://openai.com/index/gpt-5-6/)。它能力之强、速度之快、智能之高,令我*深感震撼*。我观察到它常能达到约100 tokens/秒的处理速度,在代码库、邮件和知识库中穿梭自如。
当然,luna最吸引人的还是**成本优势**。我尝试运行过一些相当复杂的研究流程,却很难累积高额账单。即便让它在数千封邮件中进行搜索,最终的API费用也仅需几十美分。
而GLM 5.3的出现,更是让我们在帕累托前沿上有了新的选择。
在进行编程工作时,我几乎总是选择最昂贵、最强大的模型(Fable 5、5.6 Sol)。这使得我们很容易忽视那些小巧快速模型取得的进步。
---
有几位投资者曾向我提到一个现象:"奇怪的是我们没看到更多消费级AI公司。这是为什么呢?"
答案很简单:token成本问题。
在AI出现之前,打造大型消费级应用的典型路径是这样的:
- 创建运行成本相对较低的引人注目的网站
- 吸引大量用户(通常借助病毒式传播)
- 融资,扩张用户规模
- 建立广告市场
这大致描述了大多数大型消费公司的成长轨迹(Google、Facebook、Snapchat等)。1 (https://calv.info/small-models-have-arrived#footnote-fn-1)
但如果你想为产品加入AI功能呢?那么现在每个请求都会产生实实在在的推理成本!所需资金量突然大幅增加。
我有个个人想法:打造一个每日新闻网站,为我个性化推荐:
> 在互联网上研究@calvinfo。推断他可能喜欢的新闻。创建一个微型网站,展示今日头条故事,内容针对他进行个性化。搜索HN、Reddit、Twitter等。
使用上一代模型(Sonnet级别),要达到基本效果大约需要花费1美元。对于消费级应用来说,每月收费30美元是不可持续的。虽然我们显然可以进行很多优化,但如果你要收取《华尔街日报》或《经济学人》的订阅费,最好能提供相当的价值。
但看看luna的表现——结果相当不错,平均成本仅约0.10美元。这就有得谈了!
---
我认为更有趣的发展方向在商业领域。
我的Segment联合创始人Peter (https://rein.pk/)最近和我徒步时交流了心得。在他的多家创业公司经历中,Peter总结出两类工作:
1. "智商180"型工作。某些疯狂的科学天才想出了你从未考虑过的绝妙方案。
2. "token喷射器"型工作。保持极高的响应速度,在几十个不同战线推动进展。
Peter管理着多家公司。除Segment外,他还为Charm Industrial (https://charmindustrial.com/blog/accelerating-carbon-removal-with-our-100m-series-b)筹集了超过1亿美元,最近刚为Revoy (https://www.revoy.com/)完成A轮融资。他极度高效且善于规划时间。
然而Peter提到,他大约95%的工作属于第二类。包括接听电话、敦促同事、处理各种琐事。
需要说明的是,Peter强调他的公司如果没有"IQ 180"型技术人才解决深层问题(https://www.linkedin.com/in/ian-rust-85a41b43/),今天早就停滞不前了。只是他本人的工作大部分属于第二类。2 (https://calv.info/small-models-have-arrived#footnote-fn-2)
我认为对"前沿级"模型的需求将持续复合增长。尤其在需要突破性创新的领域(工程、硬科学、模型训练)。
但我也认为,"快速/廉价/足够好"型模型的需求即将迎来爆发。
想想你日常互动的对象:同事、供应商、客户。十次有九次,你需要的是响应迅速、直接帮你解决问题的人。如今企业中大多数"人工token"正是以这种方式消耗——招聘明显偏向"快速/廉价/足够好"这一类型。
要让"快速/廉价/足够好"型模型真正在商业场景落地,还需要大量工作。包括新型工具链、提示注入安全防护、角色与权限管理等。但我相信我们终将攻克这些挑战。
如果你也在探索如何让小模型发挥实用价值,请随时联系我。
1. Amazon和Netflix是显著的例外↩ (https://calv.info/small-models-have-arrived#footnote-fnref-1)
2. Peter在此也很谦虚。他其实敏锐过人。↩ (https://calv.info/small-models-have-arrived#footnote-fnref-2)
相似文章
@OpenAI:我们致力于在成本效率、能力和速度方面推动模型前沿。从今天开始,我们正…
OpenAI 已将 GPT-5.6 Luna 的价格降低 80%,GPT-5.6 Terra 的价格降低 20%,并在 API 中为 GPT-5.6 Sol 推出了更快的选项,同时还调整了 Codex 和 ChatGPT Work 中的使用量计算方式。
@levie: AI成本(按任务类型标准化后)下降是推动AI进一步普及的最重要因素之一……
本文讨论了按任务类型标准化后AI成本下降如何推动进一步采用,并引用Sam Altman宣布的GPT-5.6系列模型大幅降价:Luna降价80%,Terra降价20%,Sol推出Fast模式。
推进 GPT‑5.6 的性价比前沿
OpenAI 宣布 GPT-5.6 Luna(降价 80%)和 Terra(降价 20%)大幅降价,并推出 GPT-5.6 Sol 的快速模式,API 速度提升高达 2.5 倍,旨在提高客户的成本效益。
@OpenAI:GPT-5.6 是健康智能领域的一次重大进步。在整个产品线中,我们以更低的成本提供更强的性能……
OpenAI 宣布推出 GPT-5.6,这是健康智能领域的一次重大进步,性能更强,且 GPT-5.6 Luna 的成本比 GPT-5.5 降低 25 倍,使先进模型更容易在全球范围内普及。
OpenAI推出其全新模型系列GPT-5.6
OpenAI发布了GPT-5.6,这是一个包含三个模型(Sol、Terra、Luna)的系列,具有更高的效率、更强的网络安全能力以及有竞争力的定价,主要面向企业和编码任务。