custom-kernels

标签

Cards List
#custom-kernels

我们根本不需要什么张量库:用自定义WebGPU内核解决扑克问题

Hacker News Top · 2026-07-30 缓存

作者详细介绍了他们如何使用LLM生成自定义WebGPU内核,而不是依赖通用的张量库,从而构建了一个浏览器内扑克求解器,实现了超过10倍的加速,并展示了一种范式转变,即廉价生成可以取代库抽象。

0 人收藏 0 人点赞
#custom-kernels

@no_stp_on_snek:在自定义Rust内核和Swift调度领域忙碌的一晚。9个PR中有3个是真正新增或修改的Metal内核……

X AI KOLs Timeline · 2026-07-07 缓存

在自定义Rust内核和Swift调度逻辑的优化下,Qwen3.6-35b-A3B模型的预填速度在2k提示下从255 tok/s提升到1058 tok/s,实现了约4倍的加速,解码和困惑度未受影响。

0 人收藏 0 人点赞
#custom-kernels

LFM2.5 230M 使用自定义 WebGPU 内核在浏览器中以 1,400 tok/s 运行

Reddit r/LocalLLaMA · 2026-06-25

LFM2.5 230M 模型使用自定义 WebGPU 内核在浏览器中实现每秒 1,400 个 token,展示了高效的本地推理。

0 人收藏 0 人点赞
#custom-kernels

在本地用4张老款RTX 2080 Ti运行DeepSeek-V4(2000美元预算配置)。自定义图灵内核、W8A8量化,以及255个预填充token/秒!

Reddit r/LocalLLaMA · 2026-05-20

一位开发者成功在四张RTX 2080 Ti GPU上以2500美元预算本地运行DeepSeek-V4-Flash(总计284B,激活13B),通过自定义图灵CUDA内核、W8A8量化和异构推理实现了255个预填充token/秒。该实现已开源。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈