@vikhyatk: 厌倦了手动调优GPU内核,所以我们构建了一个编译器。Photon 2.0 将 Moondream、Qwen 3.5 和 Gemma 4 编译成……
摘要
Photon 2.0 是一个新的推理引擎和编译器,可将 Moondream、Qwen 3.5 和 Gemma 4 等模型编译为巨型内核,声称在物理AI工作负载上比 vLLM 和 SGLang 的吞吐量高达 2.3 倍。
查看缓存全文
缓存时间: 2026/08/04 04:01
厌烦了手动调优 GPU 内核,所以我们构建了一个编译器。
Photon 2.0 将 Moondream、Qwen 3.5 和 Gemma 4 编译成巨型内核:整个前向传播作为一个 GPU 程序。
对于每个模型,我们使用一个 tracer DSL(追踪器领域特定语言)定义前向传播,为编译器映射出数据流和依赖关系。下面是一个简化示例,展示了一个密集 Moondream 层的情况。
然后,编译器会探索在 GPU 的 SM(流多处理器)上调度工作的各种方式。实际编译巨型内核非常慢,因此我们构建了一个仅使用 CPU 的成本模型,用于模拟给定调度的执行时间。之后,排名靠前的候选会被实际编译,以找出最佳方案。
下面展示了它为密集 Moondream 层生成的调度示意图。
它在注意力仍在扫描 KV 缓存时就开始 MLP 的 FC2 投影。当注意力完成时,大部分 MLP 工作已经完成,因此最终的输出投影可以立即结合两个结果。
哈哈,好吧,我下周会发布。
至少这样你就知道这篇文章不是 AI 垃圾了,哈哈。
我后悔错过了麦乐鸡。本来可以把发布推迟一天的……
理智?早就丢了,哈哈。
随着模型变大,在 batch size 为 1 / 单 GPU 的情况下,优化空间会变小,因为同步成本会被大型矩阵乘法分摊。但在多 GPU 推理(即更大的模型)和更高并发场景下,仍然有不少空间。
谢了,会做的!
很快就来!已加入模型待办列表。
还在竞技场里,哈哈。
哪个 GPU?
相似文章
打破 GPU 气泡
Moondream 的 Photon 推理引擎通过流水线解码消除了 GPU 气泡,实现了近乎实时的 VLM 推理,解码吞吐量提升高达 35%。
@googlegemma:“代理内核优化是端侧推理的未来” @xenovacom 使用 Fable 5 编写内核,将……
Xenova 使用 Fable 5 编写优化内核,在 M4 上的 WebGPU 中为 Gemma 4 实现了每秒 255 个 token 的速度,展示了用于端侧推理的代理内核优化。
@hank_aibtc: 猛啊!在浏览器里跑 Gemma 4,堪比 ChatGPT?! 完全零服务器、零数据上传、离线使用、纯WebGPU本地推理! Xenova把 Fable 5写的27个自定义WebGPU内核 全部开源了: - Gemma 4 E2B(23亿参…
文章介绍了Xenova开源了27个自定义WebGPU内核,使得Gemma 4模型可以在浏览器中完全离线、本地运行,性能达到255 tok/s,并讨论了隐私、离线使用等优势。同时也提到了FLUX.2的3D生成能力。
我们身在何处:一年之间,天地翻覆——Kimi、Minimax、Qwen、Gemma、GLM
作者感慨本地 AI 能力进步神速,如今借助 Qwen 27b、Minimax 2.7 等模型,在平价硬件上就能完成过去只有顶级云端大模型才能搞定的任务。
@Tono_Ken3: 我注意到可能有另一个人也意识到,在实际工作中 gemma-4-12b 能够与 qwen3.6-35b 相媲美。是的……
一条推文指出,经过 abliterated 处理、NVFP4 量化的 Gemma-4-12B 模型(7.7 GB)在实际任务中能够与 Qwen 3.6-35B 相媲美,同时在 Blackwell GPU 上运行快速,展现了显著的效率提升。