@rohanpaul_ai: 我不得不亲自测试才相信这难以置信的推理速度。单个用户使用标准数据中心 GPU 达到 3000 tokens/s。…

X AI KOLs Following 产品

摘要

Kog AI 在 8 块 AMD MI300X GPU 上实现了 3000 tokens/s 的推理速度,在 8 块 NVIDIA H200 上达到 2100 tokens/s,利用了 GPU 令牌生成中隐藏的效率差距。

我不得不亲自测试才相信这难以置信的推理速度。 单个用户使用标准数据中心 GPU 达到 3000 tokens/s。 他们利用了 GPU 生成令牌方式中隐藏的效率差距。 @Kog__AI 刚刚在 8 块 AMD MI300X GPU 上实现了 3000 tokens/s,在 8 块 NVIDIA H200 上达到 2100 tokens/s https://t.co/iKREa4v9Rw
查看原文
查看缓存全文

缓存时间: 2026/05/31 20:58

我不得不亲自测试,才敢相信这不可思议的推理速度。

单个用户在标准数据中心 GPU 上达到 3,000 tokens/s。

他们利用了 GPU 生成 token 时被忽视的效率差距。

@Kog__AI 刚刚在 8× AMD MI300X GPU 上实现 3,000 tokens/s,在 8× NVIDIA H200 上达到 2,100 tokens/s。https://t.co/iKREa4v9Rw

相似文章

标准GPU上的实时LLM推理:每请求3k tokens/秒

Hacker News Top

Kog AI 发布了 Kog Inference Engine 的技术预览版,通过协同设计模型架构、运行时和底层 GPU 代码,在标准数据中心 GPU 上实现了每请求 3,000 tokens/s 的性能,面向延迟敏感的 AI 代理工作流。

Kog 进一步深挖 GPU 推理性能

TechCrunch AI

法国初创公司 Kog 正通过软件优化大幅提升标准数据中心 GPU 上的 LLM 推理速度,声称吞吐量最高可提升 30 倍。在展示其开源的 Laneformer 2B 模型实现每秒 3000 个 token 的处理速度后,该公司现在正专注于更大的模型,并瞄准软件工程工作流。