智能的重大拆分(8分钟阅读)

TLDR AI 新闻

摘要

本文分析了人工智能中的‘智能的重大拆分’,其中代理经济学正推动从使用通用前沿模型处理所有任务,转向使用专用低成本模型处理常规工作的系统,以优化成本和效率。

代理经济学正推动人工智能从默认使用前沿模型转向基于能力层级的路由,其中判断、排名、搜索和验证使用更便宜的专用系统。前沿模型可能处理更少但更难的任务,而应用程序则成为高效重组服务的智能编译器。
查看原文
查看缓存全文

缓存时间: 2026/09/22 14:38

智能体经济学正推动AI从“默认前沿模型“转向“按能力层级路由“,其中判断、排序、搜索和验证将使用更低成本的专用系统。随着应用逐渐演变为高效重组服务的“智能编译器“,前沿模型可能只处理数量更少但难度更高的任务。


智能的大解绑

过去三年,大语言模型的奇迹在于其捆绑性。需要从文档中提取信息?调用大语言模型。想要搜索信息、对五个选项进行排序、判断某事是否可疑、选择下一个工具、浏览网站、撰写回复、验证工作成果,或者解决真正复杂的推理问题?调用大语言模型。GPT、Claude、Gemini和Kimi将众多原本分离的能力整合进一个通用产品中。这正是生成式AI的重大产品突破:开发者无需拼接十几个狭窄系统,只需将一个足够智能的模型置于应用核心,它就能处理几乎所有事务。

但这种便利性掩盖了关键问题:这些能力的计算需求差异巨大,而不同的模型已经更擅长处理捆绑组合中的不同部分。随着这些能力在性能、延迟和成本方面的差异不断扩大,符合经济理性的架构正在发生变革。

我认为我们正进入智能的大解绑时代。

为何是现在?智能体将一个用户目标转化为成百上千个机器决策,每个步骤的成本与延迟差异会复合影响整体经济性。推理已成为实际的商品销售成本,这使得成本和投资回报率日益重要。更小型和开放权重的模型已能胜任更多常规工作。搜索、检索、重排序、记忆和计算机操作正演变为独立的基础设施层。应用拥有更好的评估体系,能够准确判断低成本系统何时足够适用。而矛盾的是,前沿模型的显著进步反而使解绑更安全:应用可以大胆使用低成本智能,因为当底层廉价方案失效时,栈顶总有前沿模型待命。架构正从默认使用前沿模型、事后优化转变为默认使用廉价智能、仅在异常时调用前沿模型。在智能体的大规模推理场景中,同一目标内的不同步骤理应获得截然不同的智能投入量与类型。

这正是Jev问世的最佳时机。TypeSafe从生成式AI的捆绑组合中抽离出一项通用能力:判断。给Jev杂乱的状态信息、明确边界的问题和预定义的答案范围,它返回的是结构化决策与概率,而非开放式文本。底层理念并不新颖,创新之处在于以适合智能体内循环的成本和速度,将单个认知操作直接封装为模型层服务。如果任务仅是“查看并决策“,模型无需先生成句子再转化。Jev恰好在智能体将其转化为经济问题的时刻应运而生。

理解此现象的一个关键视角是解码器税。当软件仅需判断紧急/非紧急、继续/停止、允许/阻断或选择工具时,我们通常要求语言模型生成答案,再将输出转换回应用所需的决策。智能体持续执行此类操作,令人惊讶的是,其内循环可能根本不需要文本生成。

现在思考这对大语言模型捆绑经济性的影响。据报道Anthropic毛利率超过80%,这正是强大捆绑模式的体现。Claude能通过单一产品完成写作、分类、提取、排序、判断、编码、规划、验证和推理。如今简单的分类或验证任务之所以按前沿模型定价,仅因它发生在Claude调用内部。解绑提出了更尖锐的问题:隐藏在该调用中的每项能力的独立市场价值是多少? 复杂推理或许值得高昂溢价,但判断邮件是否紧急、排序五个检索文档、验证浏览器操作是否成功呢?当判断能力的成本竞争至分币级别,排序迁移至重排序器,搜索交给专业提供商,确定性工作转由代码处理,常规生成任务流向更廉价或开放权重模型时,应用无需直接冲击Anthropic的利润率。它们只需改变构成Anthropic利润基础的工作组合。

这为前沿推理带来逆向选择。目前前沿模型接收的是混合型工作负载。随着应用路由能力提升,它将系统性剔除廉价、可预测、高重复性的工作:浏览器模型承担重复性计算机操控,代码处理确定性推理,小型与开放权重模型完成常规生成。前沿实验室将越来越多地收到最高阶任务:陌生、模糊、长周期的问题——正是廉价系统难以确定的领域。因此前沿智能可能同时变得更强大、单次调用价值更高,但调用频率降低。更存在双重冲击的可能:不仅到达前沿模型的操作数量可能减少,由于路由优先选择了最难问题,到达它的平均操作可能需要更多测试时计算量。对前沿推理的威胁不仅来自更廉价的前沿推理,更来自其底层工作负载的分解。

一旦能力变得可分离,就必须有人重新整合它们。这正是应用层变得更重要的原因。应用不再询问“应由哪个模型处理整个任务“,而是决定“该任务需要哪些能力“。应用演变为智能编译器:接收人类目标,分解为认知操作,为每项操作购买最经济的足够能力,重组结果,仅在必要时进行升级处理。

下一步比“哪个模型应响应此提示“更深一层:谁应提供此任务中的各项能力? 当能力拥有稳定接口后,提供者便可独立进行基准测试、替换、路由和定价。智能的大解绑不会消除AI利润池,而是迫使每项能力证明自身值得占据其中一席之地。

这带来的变革远不止利润率。低成本判断能力将改变哪些产品具备经济可行性。当成本降至分币级别、耗时仅数百毫秒时,你可以为每个智能体操作后部署判断器,而非仅偶尔检查工作成果。你可以将智能注入浏览器和语音循环——在那里数秒的推理延迟都嫌太长。你可以从抽样检查1%的系统转向评估100%的实例,覆盖每段客服对话、检索过程、交易流程、理赔申请、合同条款或客户账户。这创造了持续监督、持续质保,以及全新的产品循环与用例。

当今软件无法做出的绝大多数决策,源于智能持续应用的成本过于高昂。一旦判断、排序、验证等能力足够廉价,软件就能评估每个客户、每个工作流、每个智能体操作和每种状态变更。

廉价智能拓展了软件可负担的智能化覆盖范围。真正的突破在于:智能不再是间断事件,而成为技术的背景属性。如果所有产品都能近乎免费地思考一切,世界会怎样?过去数年我们专注于向单一模型塞入多少能力,未来十年或许将转向拆分这些能力并在应用层重新组合。

相似文章

智能前沿的经济学(20分钟阅读)

TLDR AI

一旦模型超过最大必要智能,AI任务就会变得商品化,竞争转向成本和基础设施,但前沿实验室可以通过在商品化之前创造有价值的新市场而繁荣。

@oneill_c: https://x.com/oneill_c/status/2054604986269802579

X AI KOLs Timeline

文章指出,严肃的AI公司正从封装通用模型转向使用专有交互数据训练自己的专业化模型,因为在分布内智能体任务中,专业化现在经常能匹配甚至超越前沿模型,从而推动更好的单位经济效益。

AI经济学 第二部分(11分钟阅读)

TLDR AI

本文分析了AI的经济学,聚焦于GPU资源的争夺战,将人类推理的尖峰负载与智能体连续工作负载进行对比,并认为当前基础设施是为人类使用而优化的,而非要求更高的智能体推理。

精简您的智能开销(13分钟阅读)

TLDR AI

本文主张企业应通过为不同任务选用适配规模的模型与混合系统来优化AI智能开销,而非对所有应用都默认采用昂贵的前沿模型。

AI agents 正在改变人们对计算成本的看法

Reddit r/AI_Agents

本文讨论了AI代理工作流如何将优化重心从单纯的推理成本转向更广泛的挑战,如延迟、编排开销和可靠性。文章强调了向混合架构和动态模型路由发展的趋势,以应对这些多步骤工作流的复杂性。