@jino_rohit: after a lot of advice, im going to start to pick up blackwell kernels more seriously. ive mostly worked on server side …
摘要
after a lot of advice, im going to start to pick up blackwell kernels more seriously. ive mostly worked on server side and model related optimizations and pre hopper kernels. now is a good time to learn some blackwell kernels!
after a lot of advice, im going to start to pick up blackwell kernels more seriously. ive mostly worked on server side and model related optimizations and pre hopper kernels. now is a good time to learn some blackwell kernels!
相似文章
@RisingSayak: Hugging Face 的内核项目正在成长!我们希望它成为内核开发者和内核用户的首选之地…
Hugging Face 的内核项目正在扩展,并寻求贡献者参与自主内核开发,为模型提供真正的优化价值。
Blackwell 与 PDL 性能提升
Llama.cpp 现已支持适用于 Blackwell GPU 的 Nvidia 程序化依赖启动 (PDL),在 Token 生成时可带来 5-10% 的性能提升。该功能默认未启用,需通过编译标志开启。
@coffeecup2020: 如果你的显卡支持Blackwell,请阅读!https://github.com/turbo-tan/llama.cpp-tq3… 已更新turbo4/turbo3 TQ3_4…
llama.cpp的一个分支引入了TurboQuant TQ3_4S量化方法,该方法映射到Blackwell FP4张量核心,在GB10上实现高达221%的提示处理加速,同时以Q3的大小保持接近Q4的质量。
@RisingSayak: 发现更快的内核?您不应该需要重写模型来使用它。借助 Kernels,您可以选择哪个内核运行…
这个Twitter线程介绍了Hugging Face的Kernels,这是一个工具,允许用户选择和替换AI模型中支持层的优化内核实现,而无需重写整个模型。
@elliotarledge:对于那些好奇我为什么使用 Kimi Linear 巨型内核而不是 Qwen 3.6 的人,首先看看参数数量。一个是……
Elliot Arledge 解释了他为什么更喜欢使用 Kimi Linear 巨型内核而不是 Qwen 3.6 来提升内核性能,比较了参数数量、层同步、隐藏维度和架构特定的优化。讨论强调 Kimi Linear 架构更适合巨型内核实现,特别是在 RTX PRO 6000 Blackwell 上进行 batch-1 解码时。