@runinfrai:我们整个九月都在重写 GLM 5.3 Flash 背后的内核。重大版本现已在 RunInfra 上线,在 Ver…上可达 670 tok/s
摘要
RunInfra 宣布 GLM 5.3 Flash 推出重大版本,采用重写的推理内核,在 FP8、厂商原生构建上可达 670 tok/s,现已同时支持 AMD 运行,定价具备竞争力,支持 100 万 token 上下文窗口。
查看缓存全文
缓存时间: 2026/09/30 20:11
我们花了整个九月重写 GLM 5.3 Flash 背后的内核。重大版本现已在 RunInfra 上线。
670 tok/s,托管于 Vercel AI Gateway
输入 $0.11 / 1M tokens,输出 $0.45 / 1M tokens,缓存 $0.03 / 1M tokens。100 万 token 上下文。FP8,厂商原生发布。
现在它可以在 AMD 上运行。同一模型、同一 API,背后拥有更强的算力。
过去 24 小时缓存命中率达到 99.7%。每一次命中和未命中都会显示在你的控制面板中,你可以自行追踪缓存日志。
兼容 OpenAI 的 chat completions 与兼容 Anthropic 的 /v1/messages。支持文本和图像输入、工具调用、JSON 模式、流式输出。
零数据留存。绝不用于训练。
https://runinfra.ai/inference-api/glm-5-3-flash…
GLM 5.3 Flash API 定价与速度 | RunInfra
来源:https://runinfra.ai/inference-api/glm-5-3-flash RunInfra (https://runinfra.ai/) 出品 | 作者 RightNow
© 2026 RunInfra. 保留所有权利。
相似文章
@UnslothAI: 我们让 GLM-5.3-Flash 在本地运行速度提升3.3倍!本地 GGUF 推理现在快1.6–3.4倍,通过优化解码和…
Unsloth AI 宣布对 GLM-5.3-Flash 进行优化,实现1.6–3.4倍更快的本地 GGUF 推理,支持多令牌预测和运行本地模型的硬件要求。
@RayFernando1337: 哇,仓库已上线!
宣布GLM 5.3 FLASH模型的仓库已上线,初步基准测试显示在DGX SPARK硬件上每秒处理59个令牌,并承诺将有更多更新。
GLM-5.3-Flash
发布 GLM-5.3-Flash,这是一款针对快速推理和性能更新进行了优化的 AI 语言模型。
GLM 5.3 Flash (Ox Alpha) 基准测试对比
文章讨论了 GLM-5.3-Flash 模型的基准测试对比,重点介绍了其前沿智能和成本效率,该内容来自发布博客文章。
GLM 5.3 Flash Q4 在 M3 Ultra 上达到 60 token/秒 / 550 token/秒
GLM 5.3 Flash 在 Apple M3 Ultra 上的优化通过内核融合和高效内存使用,实现了最高 550 token/秒的预填充速度和 38 token/秒的推理速度,且无质量损失。