热门法国初创公司ZML发布免费产品,加速众多AI芯片上的推理
摘要
法国AI初创公司ZML发布了一款名为ZML/LLMD的免费LLM推理服务器,该服务器可在多种AI芯片上运行,包括Nvidia、AMD、Google TPU、Apple Metal和Intel Arc,旨在打破供应商锁定并优化推理性能。
ZML是一家热门的法国AI初创公司,得到图灵奖得主Yann LeCun的认可,现已发布ZML/LLMD,这款软件有望降低AI运行成本。
查看缓存全文
缓存时间: 2026/07/08 08:17
# 法国热门初创公司ZML发布免费产品,加速AI芯片推理性能 | TechCrunch
来源:https://techcrunch.com/2026/07/08/hot-french-startup-zml-releases-free-product-to-speed-inference-across-lots-of-ai-chips/
英伟达无可匹敌的市场主导地位尚未终结,但挑战者和替代选择正从四面八方涌现。
法国热门AI初创公司ZML(https://zml.ai/)——获图灵奖得主Yann LeCun背书(https://x.com/ylecun/status/1836030233796874244)——发布了推理(https://techcrunch.com/2026/07/03/artificial-intelligence-definition-glossary-hallucinations-guide-to-common-ai-terms/#inference)性能优化软件,能让多种开源大语言模型(https://x.com/steeve/status/2073166739668345255)在各种芯片(https://x.com/steeve/status/2058815921997680841)上运行——包括英伟达、AMD、谷歌TPU、Apple Metal和英特尔Arc。
ZML创始人Steeve Morin告诉TechCrunch,通过新推出的LLM推理服务器ZML/LLMD(https://zml.ai/llmd/),公司的雄心是打破现有壁垒,让不同芯片以最大可用速度(有时甚至更快)服务于AI应用场景。
Morin表示,随着AI融入工作和日常生活,优化推理(即提示词处理)的重要性已超过模型训练(https://techcrunch.com/2026/07/03/artificial-intelligence-definition-glossary-hallucinations-guide-to-common-ai-terms/#training),但幕后情况往往零散无序,软件和架构障碍导致供应商锁定。
跨芯片实现最佳性能是一项技术壮举,但在人们对AI相关成本日益担忧的背景下,这也可能成为市场颠覆者。
ZML希望为企业与云服务商提供混合使用不同芯片的选择,其中部分芯片可能成本更低或能耗更少。Morin说:“我们的想法是重新赋予人们构建自己系统的能力,实现真正的效率提升,从而推动AI的普及。”
Morin观察到,这种软件辅助可能帮助一些新兴AI芯片制造商,其中许多来自欧洲,他列举了Axelera(https://axelera.ai/)、Fractile(https://www.fractile.ai/)、Kalray(https://www.kalrayinc.com/)、OLIX(https://olix.com/)、Q.ANT(https://qant.com/)、SiPearl(https://sipearl.com/)、SpiNNcloud(https://spinncloud.com/)和VSORA(https://vsora.com/)。但对他来说,更重要的是它们来自哪个地区,而是ZML能与它们合作“完成世界上从未有人做过的事情”。
但这并不意味着Morin看空英伟达。他并非如此(https://www.thetwentyminutevc.com/steeve-morin),部分原因是英伟达现有的供应量。他告诉TechCrunch,ZML与这家AI芯片巨头关系良好,后者一直在为推理业务的崛起做准备(https://techcrunch.com/2024/11/20/nvidias-ceo-defends-his-moat-as-ai-labs-change-how-they-improve-their-ai-models/)。
推理已成为一个投资密集的领域,这一趋势甚至被称为“推理淘金热”(https://thenextweb.com/news/baseten-1-5bn-round-13bn-valuation-ai-inference)。因此ZML面临竞争,例如Baseten(https://techcrunch.com/2026/06/18/ai-inference-startup-baseten-reportedly-raising-1-5b-months-after-its-last-mega-round/)(最近估值130亿美元)、开源项目vLLM(https://vllm.ai/)的创建者创立的Inferact(https://techcrunch.com/2026/01/22/inference-startup-inferact-lands-150m-to-commercialize-vllm/),以及SGLang(https://techcrunch.com/2026/01/21/sources-project-sglang-spins-out-as-radixark-with-400m-valuation-as-inference-market-explodes/)的商业化公司RadixArk(https://www.businesswire.com/news/home/20260505077157/en/RadixArk-Launches-with-%24100-Million-in-Seed-Funding-Led-by-Accel-to-Grow-SGLang-and-Democratize-Frontier-AI-Infrastructure)。
vLLM和SGLang都与LLMD存在部分竞争,但Morin对ZML的野心涵盖更广的范围。“我们已经到了联合设计芯片的阶段,”他说。他还认为,ZML团队精简至20人是这家巴黎初创公司能够快速前进的原因,未来还有更多产品发布计划。
这个小团队还因规模而获得了充足资金。凭借他此前担任Zenly(https://techcrunch.com/2017/06/21/snapchat-buys-zenly/)工程副总裁的履历(Snapchat于2017年以九位数金额收购了Zenly),Morin从多家风投公司筹集了2000万美元,包括Harry Stebbings的20VC、>commit、AALVC、Drysdale Ventures、Xavier Niel的Kima Ventures、Kindred Capital、LocalGlobe和Puzzle Ventures。
与ZML首个公开项目——2024年发布并于3月更新(https://zml.ai/posts/zml-v2/)的推理导向ML框架(http://github.com/zml/zml)不同,ZML/LLMD并非开源。但它以免费产品形式推出,目标是了解使用情况。Morin说:“我宁愿先测量,然后在最有效的地方创收,而不是从一开始就过于贪婪,愚蠢地阻碍我的增长。”
现在判断ZML/LLMD何时会成为付费产品以及其采用情况还为时过早。但该初创公司的股东名单证实其他创始人也在关注,包括Dagger和Docker创始人Solomon Hykes、Hugging Face的Clément Delangue和Julien Chaumond,以及现在任职于AMI Labs(https://techcrunch.com/2026/03/09/yann-lecuns-ami-labs-raises-1-03-billion-to-build-world-models/)的LeCun。这也证明欧洲的AI初创公司现在可以在本土成长(https://techcrunch.com/2026/07/06/station-f-ramps-up-as-a-launchpad-for-europes-hottest-ai-startups/)。“我在巴黎以外的地方无法创办ZML,”Morin说。
*当您通过我们文章中的链接购买商品时,我们可能会获得小额佣金(https://techcrunch.com/techcrunch-affiliate-monetization-standards/)。这不会影响我们的编辑独立性。*
Anna Heim 是一位作家和编辑顾问。
您可以通过邮箱 annatechcrunch [at] gmail.com 联系或验证来自 Anna 的消息。
自2021年起,她作为TechCrunch的自由记者,报道了涵盖AI、金融科技与保险科技、SaaS与定价、全球风投趋势等一系列与初创公司相关的广泛话题。
截至2025年5月,她在TechCrunch的报道聚焦于欧洲最有趣的创业故事。
Anna 曾在各种规模的行业活动中主持小组讨论并进行现场采访,包括TechCrunch Disrupt、4YFN、South Summit、TNW Conference、VivaTech等大型科技会议。
作为The Next Web的前拉美与媒体编辑、初创公司创始人以及巴黎政治学院校友,她能流利使用多种语言,包括法语、英语、西班牙语和巴西葡萄牙语。
查看简介(https://techcrunch.com/author/anna-heim/)
相似文章
Z.ai 完全在中国AI芯片上运行GLM-5.3-Flash
Z.ai宣布,其完全在中国AI芯片上运行了GLM-5.3-Flash模型,每个token的成本与Nvidia GPU相当,并使用了一个针对内存受限硬件优化的自定义推理引擎。
@AlexJonesax: 如果你在 Mac 上运行 LLM,值得了解的两个开源 MLX 推理服务器:MTPLX (@youssofal) 利用模型自身的…
本文介绍了两个适用于 Mac 的开源 MLX 推理服务器:MTPLX 通过投机解码(无需草稿模型)优化 token 生成速度,而 oMLX 则通过持久化的 KV 缓存提升代码智能体的工作流效率。
OpenAI与Broadcom发布专为LLM推理优化的芯片
OpenAI与Broadcom发布了Jalapeño,一款专为LLM推理定制的芯片,每瓦性能显著优于当前最先进水平,从零开始为当前及未来AI模型设计。
@liquidai:推出LFM2.5-230M:这是我们最小的模型,专为快速运行而设计,可在任何地方(CPU、NPU和GPU)上运行,以实现代理型任务…
Liquid AI发布了LFM2.5-230M,这是一个拥有230M参数的小型模型,针对CPU、NPU和GPU上的快速推理进行了优化,适用于手机和机器人等设备上的代理型任务。
@TheTechDiggest:[开源 - 分布式AI与网格LLM推理] 购买昂贵的企业级GPU并不是运行大规模……的唯一方式
一条推文线程介绍了mesh-llm,这是一个开源工具,可将本地网络设备汇聚成一个统一的、兼容OpenAI的API,无需昂贵的企业级GPU即可运行大型LLM。