matmul

标签

#matmul

ggml-webgpu: 提升k-quants的预填充速度并重构Q4/Q5/Q8及k-quants的矩阵乘法 by yomaytk · Pull Request #24225 · ggml-org/llama.cpp

Reddit r/LocalLLaMA ↗ · 5天前缓存

提升了k-quants的预填充速度，并重构了llama.cpp WebGPU后端中Q4/Q5/Q8及k-quants的矩阵乘法。

0 人收藏 0 人点赞

#matmul

@HanGuo97: LLM训练建立在快速矩阵乘法（MatMuls）之上。但许多周边操作仍然作为内存受限的内核运行。CODA重新参数化……

X AI KOLs Following ↗ · 2026-05-21 缓存

CODA将LLM训练中的内存受限操作重新参数化，将其融合到矩阵乘法的epilogue中，从而利用LLM生成的内核实现了接近最先进的性能。

0 人收藏 0 人点赞

← 返回首页

提交意见反馈