@HotAisle: 太棒了。我想知道他们用的是谁的 MI300x... ;-)

X AI KOLs Following 产品

摘要

Kog 宣布在标准数据中心 GPU 上实现每请求每秒 3000+ 输出令牌的实时大语言模型推理,将此前仅限于定制芯片的高速推理引入生产硬件。

太棒了。 我想知道他们用的是谁的 MI300x... ;-)
查看原文
查看缓存全文

缓存时间: 2026/05/31 10:45

这太棒了。

我很好奇他们用的是谁的 MI300x…… ;-)

Kog (@Kog__AI): 🚀 今日发布:Kog 在标准数据中心 GPU 上,单次请求即可生成每秒 3000+ 输出 token。

我们正在将实时 LLM 推理带至企业已在生产环境中运行的硬件之上。 以往只有专用芯片才能达到的速度,现在可在通用硬件上实现。

相似文章

标准GPU上的实时LLM推理:每请求3k tokens/秒

Hacker News Top

Kog AI 发布了 Kog Inference Engine 的技术预览版,通过协同设计模型架构、运行时和底层 GPU 代码,在标准数据中心 GPU 上实现了每请求 3,000 tokens/s 的性能,面向延迟敏感的 AI 代理工作流。