@victormustar: 移动端300 tok/s太疯狂了... 开源必须赢
摘要
开源AI推理在移动端达到300 tok/s,借助WebGPU框架,Liquid AI的LFM2.5 230M模型在浏览器中达到1,400 tok/s。
查看缓存全文
缓存时间: 2026/06/27 07:54
300tok/s在移动端太疯狂了……开源必将胜利 ✊ https://t.co/aNvg2PKvAT
Xenova (@xenovacom): 在我们热切期待 Fable 5 回归的同时,我们的智能WebGPU内核优化框架一直在持续运转。
Opus 4.8 接过了 Fable 的接力棒,将 Liquid AI 全新 LFM2.5 230M 模型推至难以置信的 1,400 tok/s……并在你的浏览器中本地运行。
别眨眼,否则你就会错过。
相似文章
LFM2.5 230M 使用自定义 WebGPU 内核在浏览器中以 1,400 tok/s 运行
LFM2.5 230M 模型使用自定义 WebGPU 内核在浏览器中实现每秒 1,400 个 token,展示了高效的本地推理。
@HotAisle: 太棒了。我想知道他们用的是谁的 MI300x... ;-)
Kog 宣布在标准数据中心 GPU 上实现每请求每秒 3000+ 输出令牌的实时大语言模型推理,将此前仅限于定制芯片的高速推理引入生产硬件。
@rohanpaul_ai: 我不得不亲自测试才相信这难以置信的推理速度。单个用户使用标准数据中心 GPU 达到 3000 tokens/s。…
Kog AI 在 8 块 AMD MI300X GPU 上实现了 3000 tokens/s 的推理速度,在 8 块 NVIDIA H200 上达到 2100 tokens/s,利用了 GPU 令牌生成中隐藏的效率差距。
@Yuchenj_UW: UC Berkeley 开源了 FreeToken。惊人结果:单个 RTX PRO 6000 以 14.9 tok/s 运行 753B GLM-5.2!8GB RTX...
UC Berkeley 已开源 FreeToken,这是一个显著加快消费级 GPU 上本地 AI 推理速度的工具,在 8GB RTX 4060 笔记本电脑上实现高达 39.3 tok/s 的性能。
@LambLabs:Lamb Labs(YC S26)正在构建定制AI推理芯片,可实现20,000+ tok/s的速度,且每瓦特智能(Intelligence per Watt)比传统GPU高63倍……
Lamb Labs(YC S26)宣布推出定制AI推理芯片,声称速度可达20,000+ tok/s,且每瓦特智能(Intelligence per Watt)比传统GPU高63倍,并指出GPU之所以被广泛采用是因为其可用性,而非其适用性。