model-compilation

标签

Cards List
#model-compilation

@vikhyatk: 厌倦了手动调优GPU内核,所以我们构建了一个编译器。Photon 2.0 将 Moondream、Qwen 3.5 和 Gemma 4 编译成……

X AI KOLs Timeline ↗ · 2026-08-03 缓存

Photon 2.0 是一个新的推理引擎和编译器,可将 Moondream、Qwen 3.5 和 Gemma 4 等模型编译为巨型内核,声称在物理AI工作负载上比 vLLM 和 SGLang 的吞吐量高达 2.3 倍。

0 人收藏 0 人点赞
#model-compilation

@dair_ai: 新论文值得一读。完整的代理工作流可以蒸馏到模型权重中,以约 100 倍更低的推理成本运行…

X AI KOLs Following ↗ · 2026-05-22 缓存

本文展示了代理工作流可以蒸馏到小型微调模型中,在实现接近前沿质量的同时,与编排方法相比将推理成本降低两个数量级。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈