@HotAisle: 太棒了。我想知道他们用的是谁的 MI300x... ;-)
摘要
Kog 宣布在标准数据中心 GPU 上实现每请求每秒 3000+ 输出令牌的实时大语言模型推理,将此前仅限于定制芯片的高速推理引入生产硬件。
查看缓存全文
缓存时间: 2026/05/31 10:45
这太棒了。
我很好奇他们用的是谁的 MI300x…… ;-)
Kog (@Kog__AI): 🚀 今日发布:Kog 在标准数据中心 GPU 上,单次请求即可生成每秒 3000+ 输出 token。
我们正在将实时 LLM 推理带至企业已在生产环境中运行的硬件之上。 以往只有专用芯片才能达到的速度,现在可在通用硬件上实现。
相似文章
@rohanpaul_ai: 我不得不亲自测试才相信这难以置信的推理速度。单个用户使用标准数据中心 GPU 达到 3000 tokens/s。…
Kog AI 在 8 块 AMD MI300X GPU 上实现了 3000 tokens/s 的推理速度,在 8 块 NVIDIA H200 上达到 2100 tokens/s,利用了 GPU 令牌生成中隐藏的效率差距。
标准GPU上的实时LLM推理:每请求3k tokens/秒
Kog AI 发布了 Kog Inference Engine 的技术预览版,通过协同设计模型架构、运行时和底层 GPU 代码,在标准数据中心 GPU 上实现了每请求 3,000 tokens/s 的性能,面向延迟敏感的 AI 代理工作流。
@victormustar: 移动端300 tok/s太疯狂了... 开源必须赢
开源AI推理在移动端达到300 tok/s,借助WebGPU框架,Liquid AI的LFM2.5 230M模型在浏览器中达到1,400 tok/s。
为AMD MI300X构建LLM推理的单内核 - 每个请求最高3300输出tokens/秒 [P]
一种针对AMD MI300X GPU上LLM解码的单内核方法,每个请求可达3300输出tokens/秒,无需推测解码或量化,利用映射到芯片拓扑结构的内存访问模式。
@Tono_Ken3: 在GPU上驱动Qwen3.6-27b(100 TPS),同时在CPU上驱动Hy3-299B(25 TPS),本地LLM推理计算新时代的曙光…
演示同时在GPU上以100 TPS运行Qwen3.6-27b,在CPU上以25 TPS运行Hy3-299B,标志着本地LLM推理的一个里程碑。