@rohanpaul_ai: 我不得不亲自测试才相信这难以置信的推理速度。单个用户使用标准数据中心 GPU 达到 3000 tokens/s。…
摘要
Kog AI 在 8 块 AMD MI300X GPU 上实现了 3000 tokens/s 的推理速度,在 8 块 NVIDIA H200 上达到 2100 tokens/s,利用了 GPU 令牌生成中隐藏的效率差距。
查看缓存全文
缓存时间: 2026/05/31 20:58
我不得不亲自测试,才敢相信这不可思议的推理速度。
单个用户在标准数据中心 GPU 上达到 3,000 tokens/s。
他们利用了 GPU 生成 token 时被忽视的效率差距。
@Kog__AI 刚刚在 8× AMD MI300X GPU 上实现 3,000 tokens/s,在 8× NVIDIA H200 上达到 2,100 tokens/s。https://t.co/iKREa4v9Rw
相似文章
标准GPU上的实时LLM推理:每请求3k tokens/秒
Kog AI 发布了 Kog Inference Engine 的技术预览版,通过协同设计模型架构、运行时和底层 GPU 代码,在标准数据中心 GPU 上实现了每请求 3,000 tokens/s 的性能,面向延迟敏感的 AI 代理工作流。
@HotAisle: 太棒了。我想知道他们用的是谁的 MI300x... ;-)
Kog 宣布在标准数据中心 GPU 上实现每请求每秒 3000+ 输出令牌的实时大语言模型推理,将此前仅限于定制芯片的高速推理引入生产硬件。
Kog 进一步深挖 GPU 推理性能
法国初创公司 Kog 正通过软件优化大幅提升标准数据中心 GPU 上的 LLM 推理速度,声称吞吐量最高可提升 30 倍。在展示其开源的 Laneformer 2B 模型实现每秒 3000 个 token 的处理速度后,该公司现在正专注于更大的模型,并瞄准软件工程工作流。
@rohanpaul_ai: Qwen 3.6 27B 在 MacBook Pro M5 Max 64GB 上达到每秒34个token,本地使用 atomic[.]chat,接受率达90%,即……
Qwen 3.6 27B 在 MacBook Pro M5 Max 64GB 上本地运行,实现每秒34个token,草稿接受率达90%,通过 TurboQuant、GGUF 和 llama.cpp 实现,展示了笔记本AI推理的重大进步。
@Oluwaphilemon1: Qwen3.8-27B at 56 tok/s on a 9-year-old GPU. Let that sink in. The GPU? NVIDIA V100 32GB. A card that launched at aroun…
在NVIDIA V100 GPU上实现Qwen3.8-27B模型每秒56个令牌的推理速度,展示了使用推测解码技术在旧硬件上进行经济高效的本地AI部署。