企业界对开源AI的看法都是错的(3分钟阅读)

TLDR AI 新闻

摘要

Decagon 将 90% 的工作负载运行在微调后的开源模型上,以获得低延迟和高性能;而由于使用前沿模型的新用例激增,企业整体在开源大语言模型上的支出已降至 11%。文章认为,随着用例逐渐成熟,它们将从闭源模型迁移到开源模型。

Decagon 将约 90% 的工作负载运行在开源模型上,因为经过大量微调的小型模型能提供客服代理所需的低延迟和任务特定性能。大多数企业 AI 用例仍处于早期阶段,因此公司更倾向于选择能最大化灵活性和智能的前沿模型。随着部署不断成熟、工作流趋于稳定,许多生产工作负载很可能会从闭源模型转向专门的开源替代方案。
查看原文
查看缓存全文

缓存时间: 2026/07/07 22:36

Decagon 大约 90% 的工作负载运行在开源模型上,因为经过大量微调的小型模型能够提供客服代理所需的低延迟和特定任务性能。目前大多数企业 AI 用例仍处于早期阶段,因此公司更青睐能最大化灵活性和智能性的前沿模型。但随着部署成熟、工作流稳定,许多生产型工作负载很可能从闭源模型转向专门化的开源替代方案。


关于企业开源 AI,每个人都错了

当前的主流叙事是开源正在吞噬企业市场。最佳闭源模型与开源模型之间的能力差距已缩小至个位数。财富 500 强中有三分之一在 Hugging Face 上拥有认证账户,中国研究机构每隔几周就会发布一批接近前沿水平的开源权重模型,推理服务提供商也在激烈竞争。

与此同时,在 Decagon,我们现在大约 90% 的工作负载运行在开源模型上,而不是 OpenAI 或 Anthropic 的模型。这与大多数高速增长的应用程序公司的情况一致,而且我们看到我们合作的大型企业也在朝这个方向转变。

然而,从整体企业支出来看,趋势恰恰相反。开源模型在企业 LLM 支出中的占比已从一年前的 19% 下降至 11%。

实际趋势与流行叙事背道而驰。为什么会这样?这对未来意味着什么?

首先,解释一下为什么我们 90% 使用开源模型。这不是因为成本,也不是因为客户要求(虽然他们并不介意),而是因为我们别无选择。

当你在生产环境中运行 AI 代理进行客户服务时,延迟决定产品的成败。如果每一轮对话都需要 8 秒才能响应,这样的产品根本没人会用。因此你需要小型、快速的模型。每个模型调用并不需要知道立陶宛的首都或高中物理知识。

但开箱即用的小型模型无法达到客户要求的质量标准。只有通过对特定任务进行大量微调,它们才能达到那个水平。前沿实验室并不直接提供这种组合。你无法按照我们需要的方式微调他们最好的模型,他们的小型模型我们也无法随意改造。小型 + 微调意味着需要开放权重。成本节约是实实在在的,但只是次要因素;企业对于自托管模型的接受度是很好的附加效果,而非主要原因。

那么,为什么像我们这样的公司 90% 使用开源,而更广泛的企业数据却在下降?

答案是用例成熟度。当用例是全新的时,你希望得到你能获得的最聪明的通用模型。你还不知道问题的具体形态,所以为可能最终用不上的智能支付溢价。在那个阶段,这是正确的权衡。但一旦用例完全构建出来,当你了解了输入分布、所需行为以及需要防范的失败模式,权衡就变了。此时通用智能成为开销,你希望得到最小、最快的模型,经过微调后能极其出色地完成你的特定任务。

客户服务恰好是行业中最明显的 AI 用例之一。工作流清晰、对话量巨大、质量标准严格。这意味着像我们这样的公司仅仅是比平均企业部署走得更靠前。

而这正是悖论的答案。开源份额下降并不是因为开源在衰落,而是因为企业 AI 整体正处于成熟曲线的最初期。去年,企业停止构建并开始购买,成千上万个全新的用例同时启动。新用例运行在前沿模型上,因此闭源份额暴涨。11% 这个数字是一个分母问题:不成熟用例的增长速度比成熟用例快。

如果这个判断正确,那么今天每一个在前沿模型上进行原型开发的用例,都是未来向开源迁移的潜在对象。随着部署成熟,公司会像我们一样:蒸馏、微调、专门化。前沿实验室将继续主导探索阶段,而开源将越来越多地主导生产阶段。

然而,这个过程会比人们想象的要长。大多数用例还没有达到代理“形态”已经固化的阶段,因此不值得开始微调开源模型。

微调需要投入精力,而大多数组织缺乏相应的资源或专业知识。只有那些 ROI 极高、已经大规模全面部署的用例,才值得去做。你还需要足够的数据来确保较小的模型在特定任务上能达到与前沿模型相同的性能。

否则,直接接入一个前沿闭源模型要容易得多。你无需担心任何基础设施的维护,还可以自由地迭代和实验。

因此,LLM 支出中开源模型的份额最终会回升,但这不会在几年内发生。

相似文章

开源AI现状(15分钟阅读)

TLDR AI

Mozilla发布的《开源AI现状》报告指出,开源权重模型在许多任务上已与闭源模型达到同等水平,同时推理成本在36个月内下降了50倍。目前,大多数生产环境中的token通过开源模型路由,竞争格局已转移到上层的智能体层。