本周聚焦:OpenAI 的 Jalapeño 推理芯片、Nvidia 约129亿美元竞购 Hugging Face,以及阿里巴巴的 Qwen3.8-Flash——人工智能的成本与控制权双双生变
摘要
本文关联了近期三则 AI 领域的重要动态:OpenAI 的定制推理芯片、Nvidia 潜在收购 Hugging Face 的交易,以及阿里巴巴开源权重的 Qwen3.8-Flash 模型。这些事件共同揭示了 AI 推理经济学的变迁,并引发了对行业集中度的担忧。
我想梳理一下最近几天相互关联的三则报道,因为分开看它们是独立的新闻,但合在一起却能说明一个趋势。
1. **OpenAI 的 Jalapeño 芯片**。OpenAI 公布了其首款定制推理芯片的成果(与博通和 Celestica 合作;据报道三星参与了 HBM4)。他们声称,与 Nvidia 的 GB200/GB300 机架相比,该芯片每千瓦的吞吐量提升了 1.5–1.9 倍,端到端延迟降低了 1.7–3.6 倍。计划部署时间是 2026 年底。需要注意,这些是供应商自报的基准数据,在没有独立测试之前,应持保留态度。但这一方向——即实验室开始自研推理芯片——才是真正的信号。
2. **Nvidia 与 Hugging Face**。多家媒体(TechCrunch、Fortune)报道称,Nvidia 正以约 129 亿美元的价格接近收购 Hugging Face。HF 已成为开源模型、数据集和 Spaces 事实上的中立枢纽。Nvidia 若拥有它,必然会引发关于中立性和硬件默认设置的质疑,即使短期内一切不变。
3. **阿里巴巴 Qwen3.8-Flash**。该模型拥有 1250 亿参数,开放权重,基准测试据报道可与 Opus 4.6 和 DeepSeek V4-Flash 竞争,且定价极具攻击性。据报道,Qwen 的下载量已超过 30 亿次,领先于 Meta 和 Google,并正在对大型商业用户测试收入分成模式。
**背景补充**:本月最大的融资轮次都投向了推理基础设施(Fireworks AI 约 15 亿美元,Together AI 约 8 亿美元),而非模型训练。此外,Anthropic 的 Claude 本月经历了明显的运行时间中断。
**作为一个基于这些 API 构建应用的人,我的看法是**:贯穿这一切的主线是,推理经济学现在已成为主要议题,且成本曲线正在快速下降——部分原因来自定制芯片,部分来自来自中国的廉价开源权重模型。对于任何正在发布产品的人来说,实际意义在于:停止将模型提供商视为固定不变的选择。在您的真实工作负载上,将廉价开源模型与您付费的 API 进行基准测试,并建立备用提供商(本月发生的事已为您证明了可靠性的必要性)。
我更为警惕的是**集中化问题**——更廉价的 token 是好事,但如果芯片、开源枢纽和前沿模型最终都集中到少数几家手中,定价权最终会逆转。想听听大家的看法,尤其是关于这次收购——是过度炒作,还是对开源中立性构成了真正的问题?
相似文章
OpenAI 的 Jalapeño 芯片是科技巨头摆脱英伟达最辣的一步
OpenAI 推出了与 Broadcom 合作打造的定制推理芯片 Jalapeño,标志着科技巨头在减少对英伟达依赖方面迈出了重要一步。
OpenAI称其Jalapeño芯片可实现比竞争对手更快的AI响应
OpenAI的Jalapeño AI芯片每瓦性能提升1.5至1.9倍,延迟低于Nvidia芯片,计划年底小批量部署开始
OpenAI 的 Jalapeño 芯片专为快速大规模推理而构建,基准测试显示
OpenAI 的 Jalapeño 芯片,与 Broadcom 共同开发,在 AI 推理基准测试中显示出显著的性能提升,超越了像 Nvidia 的 Blackwell 这样的尖端处理器。该芯片针对快速、高效的大规模推理进行了优化,部署将于 2026 年底开始。
NVIDIA刚收购了大多数AI模型的所在地。ChatGPT开始在欧洲展示广告。而公司正在取消软件合同,因为AI构建得更便宜。请选择最让你担心的一个。
据报道,NVIDIA正以129亿美元收购Hugging Face,ChatGPT已在欧洲推出广告,而AI代理正导致公司跳过软件采购,标志着AI领域的重要转变。
推理的变革(阅读时长约 8 分钟)
本文分析了 Cerebras 即将进行的 IPO,将其视为 AI 硬件领域“推理变革”的信号。文章指出,尽管 Nvidia 在基于 GPU 的训练领域占据主导地位,但为了支持推理工作负载,AI 算力的未来正变得越来越异构。