精简您的智能开销(13分钟阅读)
摘要
本文主张企业应通过为不同任务选用适配规模的模型与混合系统来优化AI智能开销,而非对所有应用都默认采用昂贵的前沿模型。
查看缓存全文
缓存时间: 2026/08/20 15:39
企业AI应优化每次成功结果所消耗的智能,而非默认为所有任务都使用前沿模型。随着小型模型在特定工作负载能力阈值上取得突破,路由器、混合系统和专用执行框架能将常规任务转向更低成本、本地化或确定性执行。
智能投入的精准化策略
作者:Jaya Gupta、Avanika Narayan、Jon Saad-Falcon
前沿模型的智能水平已令人惊叹。五月,OpenAI 报告称其通用内部模型证伪了埃尔德什平面单位距离问题中的一个核心猜想——这个数学难题困扰学界近八十年。外部数学家验证了该证明;蒂姆·高尔斯表示,若由人类完成该证明,《数学年刊》将立即予以发表。Anthropic 报告称,Claude Opus 4.6 已发现并验证了超过 500 个高危漏洞,包括经过多年模糊测试、累计消耗数百万 CPU 小时的代码库中存在的缺陷。
这些成就真实存在且极具价值。当答案未知且发现它可能价值数百万时——无论是数学证明、药物靶点、零日漏洞还是陌生的市场结构——我们理应追求极致智能。投入更多算力探索更多可能性是理性的选择。
但公开的排行榜只展示那些能清晰陈述和验证的工作:证明、补丁、漏洞利用和科学推理。
问题在于,经济体系的其他部分并非如此运作。
理赔调查员并非在寻找新的数学真理。她是在判断公司现有规则如何适用于这起事故、这份保单和这一系列事件。护士并非在发明医学,而是将既定诊疗方案与患者的病史、当前症状以及医院的具体限制相结合。物流协调员并非在发现新算法,而是应对今日的库存、天气、合同和延误情况。某些工作通过拓展认知边界创造价值,但大多数工作是通过在组织已知范围内做出正确决策来创造价值。
经济体系不是研究实验室
前沿研究极具价值但应用范围狭窄。美国劳工统计局数据显示,生命科学、物理科学和社会科学相关职业占美国就业总数不到 1%。美国仅有约 2,000 名数学家、20,000 名物理学家和 37,000 名计算机与信息研究科学家,却拥有数百万护士、管理人员、行政人员、物流工作者和客服代表。
大多数公司并非整天忙于探索“未知答案”,而是在客户、政策、库存、合同和历史背景形成的数百万决策中应用已有知识。
因此,虽然前沿领域是智能问题,但经济体系的其他部分是“情境与执行”问题——这种差异在财富 500 强企业中清晰可见。以沃尔玛为例,其核心是协调库存、门店与供应商;联合健康集团专注于协调医疗服务;亚马逊则在庞大规模上运营仓储、配送、商家和客户交互。
让这些公司建立护城河的并非卓越的“前沿”智能,而是专有数据、密集的运营情境、长期积累的流程、供应商关系、监管许可、实体网络,以及经历数百万次同类决策所锤炼出的判断力。它们的优势不在于比别人更会思考,而在于数十年实践中早已洞察自身世界的运行规律。
想象将美国航空、家得宝或美敦力的每位员工替换为奥数冠军,让每个人以探索难题的方式处理所有任务——成本不会下降,反而会因每个常规决策都被迫从第一性原理重新审视而急剧飙升。组织将被无法有效利用或吸收的智能淹没。
编程是重要例外:这是个庞大的劳动力市场,工作成果数字化,结果通常可通过测试验证。这使得额外模型智能变得异常有价值。然而,前沿实验室的产品设计往往鼓励开发者消耗大量 token:长时间运行的智能体循环、递归子智能体生成以及“持续运行直到成功”的模式。即便如此,随着更小规模的开源模型在日益广泛的工作类别中接近前沿性能,编程领域也开始形成能力阈值。
每类工作负载都有智能阈值
每类工作负载都存在智能阈值。低于阈值时,模型无法完成任务;接近阈值时,更高的智能创造巨大价值;一旦跨越阈值,瓶颈便发生转移。此时成果越来越取决于系统是否了解公司政策、客户、历史、工具和标准,以及能否可靠、快速、低成本地执行。
模型智能持续提升,但大多数工作负载的需求并未增长。以退款政策、行李规则和发票核对流程为例——这些任务并未变得更复杂。最新的前沿模型(尤其是 Anthropic 的产品)专为“极限”智能优化,即研究数学家、物理学家和工程师解决未解难题所需的那种智能。这个市场真实存在但规模有限。问题在于,当这些模型成为普通企业工作的默认选择时,开发者自然倾向于选择最强大的系统。Anthropic 的产品使这种选择毫无阻力:长时间运行的智能体、递归子智能体和高能耗推理循环在设计上消耗大量 token。结果是前沿级智能被应用于许多无需如此的任务。
两种趋势正在侵蚀这种溢价:从封闭模型转向开源模型,降低了给定能力水平的成本;从前沿规模转向中小型模型,将同等能力压缩到更小的算力框架中。Qwen3.8-27B 便是后者的例证:仅 270 亿参数,却在多项编程和智能体基准测试中匹配或超越 Opus 4.6 Max。我们的智能效率研究同样印证这一方向:单位焦耳智能 16 个月提升 18 倍,以更少算力、能耗和成本提供相当能力。
随着更多模型跨越普通企业工作的智能阈值,前沿系统应仅用于那些额外智能仍能改变结果的小部分任务。
企业在招聘时已深谙此道:是否曾雇用过资历远超岗位需求的员工?他们可能质疑既定决策、引入不必要的复杂性、因厌倦而离职。组织本应选择能力足够且理解客户与实际工作流程的人才。模型同样“资历过剩”,且失败模式更持久:它们不会因厌倦而退出,而是持续生成额外复杂性、不确定性和成本。密码重置不会因智能体考虑十二种解释、启动安全调查或撰写个性化文章而改善——验证用户身份后,任务就是安全重置密码并终止。
“资历过剩”正从比喻变为可量化指标。研究推理模型的学者记录了“过度思考”问题:模型常在简单问题上消耗额外推理算力却不提升准确率。亚马逊研究者估计,推理系统在简单任务上可能生成7到10倍的必要 token。因此,智能的边际价值不仅在递减,在足够简单的工作负载上,边际推理 token 可趋近于零。
任务失败是因为模型不够智能,还是因为它不懂企业运作方式?继续将“最大化智能”作为默认策略的企业,将为不再需要的工作支付前沿价格。正确姿态恰恰相反:应预设开源与专用系统将持续渗透技术栈,仅将前沿模型保留给仍高于能力增长线的问题。
实验室与企业激励相左
实验室与企业的激励存在根本冲突。模型实验室通过让算力发挥更大效用获胜,其成功指标是消耗的 token 数、会话时长、智能体数量、推理深度和解决更难问题的能力。每售出额外单位的智能都是胜利。实验室倾向于让前沿模型成为默认选择,鼓励更长思考、更多工具、更多重试和更多智能体。使用量增长时,其仪表盘便闪烁光芒。
企业则通过使重复计算变得不必要获胜,其成功指标是每次验证解决的成本、每个已处理理赔的 token 数、完成时间、升级率和客户结果。当企业学会将循环请求转化为三点摘要、确定性规则或完全无需调用模型时,实验室便失去一项未来收入来源。
提供商没有动机帮助客户消除调用、将其路由至更廉价的替代方案或压缩为软件。企业一旦学会,双方的分歧便绝对化:实验室仍在试图销售更多智能,企业则试图减少需求。数据已显示这种差距:OpenAI 报告称,每个企业组织的平均推理 token 消耗在过去一年增长约 320 倍;普华永道对 4,454 位 CEO 的调查显示,56% 的受访者尚未从 AI 中看到显著财务收益。
可衡量的业务成果并未同步增长。一方按自身定义获胜,另一方则没有。模型仪表盘显示 token 使用量增长五倍,对实验室是成功,对首席财务官却是未解之谜:客户留存率是否提升?单次成功解决成本是否下降?还是我们只是在同样的工作中消耗了更多智能?这不是同一场游戏——一方为增加火势而获酬,另一方为扑灭火并防止复燃而拿钱。
架构追随经济逻辑
若企业的目标是降低每次成功结果消耗的智能,就不能将所有智能消费决策交给模型提供商。这种控制权必须存在于企业内部的每个层级。对未来的三个预测:
将出现数百万个路由器和网关,部署于每个严肃的 AI 框架内、策略层、团队层级和组织层面。每个路由器将为每项工作单元决定其应分配至前沿模型、更小的开源模型、本地模型、确定性系统、人工处理还是无需处理。这个路由层的最终市场规模将类似劳动力本身——绝大多数常规决策由本地廉价处理,仅极小部分真正的探索性工作保留给高阶智能。其上,每个组织将拥有强制执行安全与数据驻留要求、协商成本、设定预算并确定不同工作类别可用模型的网关。
第二,混合工作负载将成为默认模式。一旦应用能分配智能,工作负载便不再归属于单一模型。当前几乎所有查询默认发送至云端,即使数据敏感、任务简单或答案已存于企业系统内——这昂贵、缓慢且常不必要。未来,任务中简单、重复或私密的部分将留在本地或源系统附近,仅真正困难或新颖的部分发送至云端前沿模型。在我们的“Minions”研究中已展示这种架构雏形:前沿云端模型分解复杂长上下文问题,较小本地模型执行子任务。混合系统以5.7倍低成本恢复前沿模型97.9%的准确率;更激进的配置以30.4倍低成本达到**87.9%**准确率。重要结果在于架构而非经济性:高成本智能对决定所需工作最有效,而非用于执行每个单元。
第三,AI将通过两个互补的应用层面渗透。通用主动助手(如Instinct)将使智能无处不在,它们观察工作、识别机会、主动发起任务。专用应用(如Maximor和PlayerZero)则通过控制情境、工具、权限、工作流状态和特定任务的完成定义,将企业意图转化为可靠执行。
在这些框架之下,新的优化层将涌现。Applied Compute等平台的AC2系统允许企业在现有应用内训练、评估、服务和替换运行的模型。框架保持执行系统角色;AC2帮助其内部智能变得更好、更快、更经济。
主动助手成为需求聚合器。应用框架成为执行系统。AC2成为连接生产经验与模型的专有化改进基础设施。它持续推动每个工作负载转向仍能产出正确结果的最低成本系统。
最智能的企业不会盲目追逐所有工作都使用“前沿模型”,而是学会尽可能减少对智能的依赖,将昨日昂贵的推理转化为明日更廉价、更可靠的执行。
进步的衡量标准不再是企业负担得起多少智能消耗,而是每次成功结果消耗的智能下降至零的速度有多快。
感谢 Ashu Garg 的审阅 :)
相似文章
专业化胜过规模化:大多数AI采购决策忽略的一个战略变量
本文认为,在特定企业领域,专业小型模型可以以极低的成本超越更大的前沿模型,并以DharmaOCR模型作为案例研究。它强调了训练历史与部署任务的一致性如何使参数数量不再起决定性作用。
@rhythmrg: https://x.com/rhythmrg/status/2066561780495896785
文章认为,企业应该对自定义AI模型进行后训练,用于关键任务、高容量的用例,以实现差异化、节省成本并对权衡进行控制,而不是仅仅依赖通用前沿模型。
每个AI提示都需花费成本——这改变了一切
文章认为,AI的真正挑战不仅在于构建更智能的模型,更在于以规模化的方式降低成本效率,强调了减少token使用、提升速度以及优化基础设施的重要性。
我们是否默认过度配置了AI智能体?
文章认为,许多AI智能体工作流将每个任务都路由到前沿模型,浪费了资金,并建议对简单、结构化的任务使用更便宜的模型层级,同时将更困难的任务升级。文章提供了一个成本比较,显示分层方法可节省高达75%的费用。
你的AI战略是在烧钱还是创造资本?
本文批判了当前企业中的AI狂热,由于Token滥用等低效使用方式,飙升的成本往往超过投资回报率。文章倡导同时关注组织流畅性和算法成本降低(例如观察掩码),从而将AI从资本消耗者转变为价值创造者。