@vikhyatk: 厌倦了手动调优GPU内核,所以我们构建了一个编译器。Photon 2.0 将 Moondream、Qwen 3.5 和 Gemma 4 编译成……

X AI KOLs Timeline 产品

摘要

Photon 2.0 是一个新的推理引擎和编译器,可将 Moondream、Qwen 3.5 和 Gemma 4 等模型编译为巨型内核,声称在物理AI工作负载上比 vLLM 和 SGLang 的吞吐量高达 2.3 倍。

厌倦了手动调优GPU内核,所以我们构建了一个编译器。 Photon 2.0 将 Moondream、Qwen 3.5 和 Gemma 4 编译为巨型内核:整个前向传播都在一个 GPU 程序中完成。https://t.co/s0cha3o0Un
查看原文
查看缓存全文

缓存时间: 2026/08/04 04:01

厌烦了手动调优 GPU 内核,所以我们构建了一个编译器。

Photon 2.0 将 Moondream、Qwen 3.5 和 Gemma 4 编译成巨型内核:整个前向传播作为一个 GPU 程序。

对于每个模型,我们使用一个 tracer DSL(追踪器领域特定语言)定义前向传播,为编译器映射出数据流和依赖关系。下面是一个简化示例,展示了一个密集 Moondream 层的情况。

然后,编译器会探索在 GPU 的 SM(流多处理器)上调度工作的各种方式。实际编译巨型内核非常慢,因此我们构建了一个仅使用 CPU 的成本模型,用于模拟给定调度的执行时间。之后,排名靠前的候选会被实际编译,以找出最佳方案。

下面展示了它为密集 Moondream 层生成的调度示意图。

它在注意力仍在扫描 KV 缓存时就开始 MLP 的 FC2 投影。当注意力完成时,大部分 MLP 工作已经完成,因此最终的输出投影可以立即结合两个结果。

哈哈,好吧,我下周会发布。

至少这样你就知道这篇文章不是 AI 垃圾了,哈哈。

我后悔错过了麦乐鸡。本来可以把发布推迟一天的……

理智?早就丢了,哈哈。

随着模型变大,在 batch size 为 1 / 单 GPU 的情况下,优化空间会变小,因为同步成本会被大型矩阵乘法分摊。但在多 GPU 推理(即更大的模型)和更高并发场景下,仍然有不少空间。

谢了,会做的!

很快就来!已加入模型待办列表。

还在竞技场里,哈哈。

哪个 GPU?

相似文章

打破 GPU 气泡

Hacker News Top

Moondream 的 Photon 推理引擎通过流水线解码消除了 GPU 气泡,实现了近乎实时的 VLM 推理,解码吞吐量提升高达 35%。

@hank_aibtc: 猛啊!在浏览器里跑 Gemma 4,堪比 ChatGPT?! 完全零服务器、零数据上传、离线使用、纯WebGPU本地推理! Xenova把 Fable 5写的27个自定义WebGPU内核 全部开源了: - Gemma 4 E2B(23亿参…

X AI KOLs Timeline

文章介绍了Xenova开源了27个自定义WebGPU内核,使得Gemma 4模型可以在浏览器中完全离线、本地运行,性能达到255 tok/s,并讨论了隐私、离线使用等优势。同时也提到了FLUX.2的3D生成能力。