Z.ai 完全在中国AI芯片上运行GLM-5.3-Flash
摘要
Z.ai宣布,其完全在中国AI芯片上运行了GLM-5.3-Flash模型,每个token的成本与Nvidia GPU相当,并使用了一个针对内存受限硬件优化的自定义推理引擎。
暂无内容
查看缓存全文
缓存时间: 2026/08/27 21:28
# Z.ai完全使用国产AI芯片运行GLM-5.3-Flash
来源:https://www.implicator.ai/zai-glm-5-3-flash-chinese-chips-nvidia-cost/
AI新闻 (https://www.implicator.ai/tag/ai-news/)
## Z.ai称国产芯片在运行GLM-5.3-Flash时的成本与英伟达相当
Z.ai表示,其为期一周的匿名GLM-5.3-Flash预览完全运行在中国国产加速器上,其每token成本称与英伟达GPU相当。该公司未指明芯片供应商,也未公布吞吐量或功耗数据。服务部署也相对是问题中较易的一半。
Z.ai周三表示,GLM-5.3-Flash为期一周的匿名预览完全运行在中国国产芯片上,并实现了与主流英伟达GPU相当的每token成本。一个定制的服务栈在数万个国产加速器上处理了此次预览。服务部署结果并不能证明相同的硬件能完成前沿模型的训练运行。
## 关键变化
- Z.ai称,为期一周的匿名GLM-5.3-Flash预览运行在数万个中国国产加速器上。
- 该公司报告其每token成本与主流英伟达GPU相当,但未指明芯片供应商,也未公布吞吐量、功耗或利用率数据。
- 服务部署不等于训练。DeepSeek的R2模型即使在华为派出工程师现场支持后,也未能在昇腾硬件上完成训练。
- 供应是更严峻的制约因素。SemiAnalysis预计CXMT在2026年的HBM产量仅够生产25万至30万套Ascend 910C等效封装。
AI生成摘要,经编辑审核。更多关于我们的AI准则 (https://www.implicator.ai/about/)。
## 围绕内存构建的服务栈
技术披露 (https://z.ai/blog/glm-5.3-flash?ref=implicator.ai) 描述了一个基于SGLang构建的自定义推理引擎,专为内存容量和带宽受限的芯片设计。当提示词接近模型百万token上下文限制 (https://huggingface.co/zai-org/GLM-5.3-Flash?ref=implicator.ai)(在8月26日发布会上公布)时,压力会增加。
Z.ai将多模态编码、提示词预填充和逐token解码拆分为独立调度的工作池。这种“编码-预填充-解码”设计允许运维人员在某个工作负载出现瓶颈时针对性扩容,而非要求每个加速器处理完整序列。
其他措施压缩了模型权重和键值缓存,使得内存有限的芯片能承载更多负载。公司在同一次发布会公布的预览中全程使用了这种架构。
该模型拥有3200亿参数,但每个token仅激活180亿参数。与GLM-5.3相比,Z.ai在发布时测得注意力计算量减少了两倍,键值缓存缩小了4.4倍。
GLM-5.3的基础设施智能体还帮助工程师开发内核和诊断瓶颈,“创建了一个模型帮助优化服务该模型自身的系统的反馈循环”。
## 声明未涵盖的内容
Z.ai未披露芯片型号或供应商。作为最大国内供应商,华为在2025年出货了81.2万块AI加速器,在中国市场约400万块的总量中占20.3%份额,而英伟达出货220万块,占55%。Z.ai未公布功耗、精确吞吐量、利用率或标准化的英伟达对比数据。从周三发布的材料无法验证其成本相当的断言,且服务结果尚未经过独立审计。
服务部署不等于训练。Z.ai表示预览和后续推理运行在中国加速器上,但并未说明GLM-5.3-Flash完全在这些芯片上训练。
## 免费工作日晨间简报
不错过下一个重要的AI故事。
The Implicator晨间简报过滤AI新闻周期,精选值得您关注的故事并解释其影响。每周工作日太平洋时间凌晨4:45(东部时间上午7:45)从旧金山发出。
电子邮件地址请查看收件箱。点击链接确认。
大约五分钟。无炒作。无垃圾邮件。
华为的昇腾处理器可以运行推理工作负载,但DeepSeek的R2训练工作 (https://www.tomshardware.com/tech-industry/artificial-intelligence/deepseek-reportedly-urged-by-chinese-authorities-to-train-new-model-on-huawei-hardware-after-multiple-failures-r2-training-to-switch-back-to-nvidia-hardware-while-ascend-gpus-handle-inference?ref=implicator.ai) 未能在其上可靠完成。即使在华为派出自己的工程师现场后,团队仍无法在昇腾硬件上完成一次成功的完整训练,导致R2的发布推迟了数月。DeepSeek为训练切回英伟达芯片,但保留昇腾硬件用于推理。
## 声明附带的价格
2026年8月26日,Z.ai将标准GLM-5.3-Flash访问定价为:输入每百万token 0.15美元,缓存输入每百万token 0.03美元,输出每百万token 0.50美元。发布优惠在2026年9月9日前将价格减半。同期发布的GLM-5.3,输入和输出每百万token的成本分别为1.40美元和4.40美元。
在发布材料中,Z.ai报告其在Artificial Analysis Intelligence Index 4.1.1版本中的得分为57,在优惠层级下每任务成本为0.045美元。该分数尚未出现在Artificial Analysis排行榜上。Z.ai表示,这个分数之前的成本大约是现在的十倍。
## 供应是更严峻的制约因素
TrendForce预测 (https://www.tomshardware.com/tech-industry/artificial-intelligence/chinas-homegrown-ai-accelerators-to-supply-90-percent-of-the-countrys-domestic-market-analysts-suggest-cambricon-and-huawei-expected-to-be-the-biggest-winners-in-the-shift-away-from-nvidia-and-amd?ref=implicator.ai),国产加速器将在2026年占据中国高端市场近90%的份额,高于2025年的45%。要将市场维持在2025年约400万块的基数,需要中国供应商在2026年替代约196万块国外加速器,并将自身产量从2025年提高2.2倍。
高带宽内存和先进封装能力仍是瓶颈。中国公司在出口管制收紧前已从三星囤积了约1300万条HBM堆栈。SemiAnalysis估计 (https://newsletter.semianalysis.com/p/huawei-ascend-production-ramp?ref=implicator.ai),CXMT 2026年的产量约为200万条,仅够生产25万至30万套Ascend 910C等效封装。这个上限与中芯国际有多少逻辑芯片产能无关。
由于权重在MIT许可证下公开,外部开发者现在可以下载GLM-5.3-Flash并自行测量其服务效率。
## 常见问题
Z.ai实际上对国产芯片做了什么声明?
称GLM-5.3-Flash为期一周的匿名预览完全运行在中国国产加速器上,跨越数万个,每token成本与主流英伟达GPU相当。
使用了哪些中国芯片?
Z.ai未透露。未指明芯片型号或供应商。华为是最大的国内供应商,2025年出货了81.2万块AI加速器,在中国市场约400万块的总量中占20.3%份额,而英伟达出货220万块,占55%。
GLM-5.3-Flash是否也在中国芯片上训练?
Z.ai表示预览和后续推理运行在中国加速器上,但并未说明模型完全在这些芯片上训练。DeepSeek的R2训练工作未能在华为昇腾硬件上完成,并为训练切回了英伟达芯片。
GLM-5.3-Flash的成本是多少?
2026年8月26日,标准访问定价为:输入每百万token 0.15美元,缓存输入每百万token 0.03美元,输出每百万token 0.50美元。发布优惠在2026年9月9日前将价格减半。GLM-5.3的输入和输出每百万token成本分别为1.40美元和4.40美元。
有人验证过这些服务声明吗?
目前还没有。服务结果尚未经过独立审计,且Artificial Analysis Intelligence Index的57分来自Z.ai自己的发布材料,而非Artificial Analysis排行榜。权重在MIT许可证下公开,因此外部开发者现在可以自行测量。
AI生成摘要,经编辑审核。更多关于我们的AI准则 (https://www.implicator.ai/about/)。
## 英伟达在GTC不只是发布了芯片,更是推出了一个锁定机器。周一在圣何塞SAP中心,黄仁勋举起一块芯片。在舞台灯光下缓慢而刻意地旋转,就像他一贯的那样。像珠宝商展示钻石。三万人 The Implicator (https://www.implicator.ai/nvidia-didnt-just-launch-chips-at-gtc-it-launched-a-lock-in-machine/)
GLM-5.1无需你也能工作八小时。没有基准能衡量这一点。4月7日几个小时内,Z.ai看起来仿佛赢得了人工智能界最爱的室内游戏之一:登顶编程基准测试。但到晚上,Anthropic就夺回了桂冠。不过Z.ai可能 The Implicator (https://www.implicator.ai/glm-5-1-works-eight-hours-without-you-no-benchmark-measures-that-2/)
Implicator.ai推出AI Top 40,用一个分数对10个基准测试的LLM进行排名 Implicator.ai周五发布了AI Top 40,这是一张每周图表,抓取10个独立基准测试,并将它们浓缩为每个模型一个数字。来自18个实验室的40个模型入选。该图表更新 The Implicator (https://www.implicator.ai/implicator-ai-launches-the-ai-top-40-ranking-llms-across-10-benchmark-s-in-one-score/)
Marcus Schuler (https://www.implicator.ai/author/marcus-schuler/)
旧金山
Implicator.ai主编兼创始人。曾任ARD记者及高级广播记者,拥有10余年科技报道经验。每日撰写关于政策与市场动态的简报。常驻旧金山。电子邮件:[email protected]
晨间简报
### 每个工作日上午一封,改变决策的AI新闻。
为必须根据新闻采取行动(而不仅仅是关注)的高管和战略家们撰写。
相似文章
GLM-5.3 Flash 在中国硬件上运行的实际含义
Z.AI 确认 GLM-5.3 Flash 运行于中国硬件上,这表明了中国 AI 能力的进步,同时突显了在半导体制造方面与西方竞争对手的持续差距。
Z.ai 建造了一个千兆瓦级人工智能数据中心(3分钟阅读)
Z.ai 完成了一个完全由中国制造芯片供电的千兆瓦数据中心,扩大了用于训练其先进 GLM 模型的计算基础设施。
GLM-5.3:中国实验室如何跟上前沿步伐(11分钟阅读)
Z.ai的GLM-5.3模型展示了卓越的基准测试性能,超越了像Kimi K3这样的大型模型,并与前沿模型相媲美,突显了中国AI实验室在训练后效率方面的进步。
中国正走向计算自主 - 摘自GLM 5.3 Flash博客
中国在计算自主化方面取得进展,以GLM-5.3-Flash AI模型的发布为亮点,该模型承诺以经济高效的方式提供前沿智能。
@rohanpaul_ai: 据The Information报道,继DeepSeek之后,智谱AI也在探索定制ASIC,因其GLM-5.2的使用量据报道增长了27倍…
智谱AI正在继DeepSeek之后探索定制ASIC,因为GLM-5.2的使用量在一周内增长了27倍,凸显了中国AI行业向大规模推理专用硬件的转变。