@TechMDAI: GLM-5.3-Flash EXL3-3.0bpw 由 @0xSero、@BrandonMusicKy、@LottoLabs、@localmaxxing 实现,速度 193.8 tokens/s
摘要
这篇文章重点介绍了 GLM-5.3-Flash EXL3-3.0bpw AI 模型,其推理速度达到每秒193.8个令牌,归功于多位贡献者。
GLM-5.3-Flash EXL3-3.0bpw 由 @0xSero @BrandonMusicKy @LottoLabs @localmaxxing 贡献
193.8 tokens/s https://t.co/aJIBGyb0W1
查看缓存全文
缓存时间: 2026/08/30 22:13
GLM-5.3-Flash EXL3-3.0bpw 模型展示 @0xSero @BrandonMusicKy @LottoLabs @localmaxxing
193.8 tok/s https://t.co/aJIBGyb0W1
相似文章
GLM-5.3-Flash @ DGX Station GB300: 约206 tokens/秒(单流),1M上下文
用户在DGX Station上对GLM-5.3-Flash AI模型进行基准测试,实现了约206 tokens/秒的单流推理速度,上下文窗口为100万,并分享了设置的Docker命令。
GLM-5.3-Flash
发布 GLM-5.3-Flash,这是一款针对快速推理和性能更新进行了优化的 AI 语言模型。
@Yuchenj_UW:GLM-5.3 达到 310 token/s!Databricks 推理速度和延迟再次位居第一。在我们的内部 Databricks 编程基准测试中……
GLM-5.3 在 Databricks 推理平台上达到每秒 310 token 的速度,在速度和延迟方面均处于领先地位,并且是最强的编程开源模型,可与 Fable 5 和 Opus 4.8 竞争。
@Ex0byt: 更新:通往GLM-5.2之路:我们快到了,各位!未量化、未剪枝的DeepSeek-v4-Flash。单台……上11 tok/s
关于在单台DGX Spark上使用sglang推理和自定义mega-kernel以11 tok/s运行未量化的DeepSeek-v4-Flash模型的更新,正在向GLM-5.2迈进。
@philipkiely: https://x.com/philipkiely/status/2069212319746506968
Baseten 宣布推出针对 GLM-5.2 开源模型的世界最快 API,通过 NVFP4 量化、分离式推理等优化,实现每秒超过 280 个 token 的处理速度。