@runinfrai:我们整个九月都在重写 GLM 5.3 Flash 背后的内核。重大版本现已在 RunInfra 上线,在 Ver…上可达 670 tok/s

X AI KOLs Timeline 产品

摘要

RunInfra 宣布 GLM 5.3 Flash 推出重大版本,采用重写的推理内核,在 FP8、厂商原生构建上可达 670 tok/s,现已同时支持 AMD 运行,定价具备竞争力,支持 100 万 token 上下文窗口。

我们整个九月都在重写 GLM 5.3 Flash 背后的内核。重大版本现已在 RunInfra 上线 在 Vercel AI Gateway 上可达 670 tok/s 每 100 万输入 token $0.11,每 100 万输出 token $0.45,每 100 万缓存 token $0.03。100 万 token 上下文。FP8、厂商原生版本 现已支持 AMD 运行。同一个模型、同一套 API,背后有更大的算力支撑 过去 24 小时缓存命中率达 99.7%。每次命中和未命中都会显示在你的仪表盘上,你可以自行追踪缓存日志 兼容 OpenAI 的 chat completions 以及 Anthropic 的 /v1/messages。支持文本和图片输入、工具调用、JSON 模式、流式输出 零数据留存。绝不用于训练 https://runinfra.ai/inference-api/glm-5-3-flash…
查看原文
查看缓存全文

缓存时间: 2026/09/30 20:11

我们花了整个九月重写 GLM 5.3 Flash 背后的内核。重大版本现已在 RunInfra 上线。

670 tok/s,托管于 Vercel AI Gateway

输入 $0.11 / 1M tokens,输出 $0.45 / 1M tokens,缓存 $0.03 / 1M tokens。100 万 token 上下文。FP8,厂商原生发布。

现在它可以在 AMD 上运行。同一模型、同一 API,背后拥有更强的算力。

过去 24 小时缓存命中率达到 99.7%。每一次命中和未命中都会显示在你的控制面板中,你可以自行追踪缓存日志。

兼容 OpenAI 的 chat completions 与兼容 Anthropic 的 /v1/messages。支持文本和图像输入、工具调用、JSON 模式、流式输出。

零数据留存。绝不用于训练。

https://runinfra.ai/inference-api/glm-5-3-flash…


GLM 5.3 Flash API 定价与速度 | RunInfra

来源:https://runinfra.ai/inference-api/glm-5-3-flash RunInfra (https://runinfra.ai/) 出品 | 作者 RightNow

© 2026 RunInfra. 保留所有权利。

相似文章

@RayFernando1337: 哇,仓库已上线!

X AI KOLs Following

宣布GLM 5.3 FLASH模型的仓库已上线,初步基准测试显示在DGX SPARK硬件上每秒处理59个令牌,并承诺将有更多更新。

GLM-5.3-Flash

Hacker News Top

发布 GLM-5.3-Flash,这是一款针对快速推理和性能更新进行了优化的 AI 语言模型。