在@huggingface上发布我的第一个内核:MaxSim后期交互检索(ColBERT / PyLate)的瓶颈在于材料……

X AI KOLs Following 工具

摘要

在 Hugging Face 上发布了一个内核,通过使用分块评分和 SIMD 组矩阵运算(Metal 和 WMMA)来加速 MaxSim 后期交互检索,比朴素实现获得了 3–5 倍的加速。

在 @huggingface 上发布我的第一个内核: MaxSim 后期交互检索(ColBERT / PyLate)的瓶颈在于实例化完整的相似度矩阵。这个内核通过使用带有 simdgroup_matrix(Metal)和 WMMA 的分块评分来避免这一瓶颈。 结果相比朴素实现实现了 3–5 倍的加速 https://t.co/Ux5H1i1jTN
查看原文
查看缓存全文

缓存时间: 2026/05/18 12:30

在 @huggingface 上发布我的第一个内核: MaxSim

延迟交互检索(ColBERT / PyLate)在计算完整相似度矩阵时存在瓶颈。这个内核通过使用 simdgroup_matrix(Metal)和 WMMA 进行分块评分,避免了这一问题。

相比朴素实现,性能提升了 3–5 倍。https://t.co/Ux5H1i1jTN

相似文章

Metal-Sci:用于 Apple Silicon 上 LLM 驱动演化内核搜索的科学计算基准

Hugging Face Daily Papers

Metal-Sci 推出了一项包含 10 个任务的基准测试,用于优化 Apple Silicon 上的科学计算内核,并配套了由大语言模型驱动的演化搜索框架。该研究评估了 Claude Opus 4.7、Gemini 3.1 Pro 和 GPT 5.5 等模型,在实现显著加速的同时,利用分布外测试来捕获静默的性能退化问题。

@Akashi203: 我开源了 AutoMegaKernel —— 将任意 HuggingFace 模型编译成一个持久的单一兆核,batch-1 解码带宽受限……

X AI KOLs Timeline

AutoMegaKernel 是一个开源代理框架,能将任意 HuggingFace 模型编译成一个持久的单一兆核(megakernel),将整个前向传播融合到一次 GPU 启动中,从而减少开销。在 L4 和 L40S 等推理级 GPU 上,它相比使用 CUDA Graph 的 cuBLAS 实现了最高 1.33 倍的加速,同时保证调度没有死锁和竞争条件。