@antoine_chaffin: 无论你是GPU匮乏者还是GPU富裕者,今天发布的PyLate总有一款适合你!GPU追求者:MaxSim内核显著…
摘要
PyLate的发布引入了MaxSim内核,用于GPU加速训练,内存需求更低;以及TACHIOM,用于在CPU上实现快速多向量索引和搜索。
查看缓存全文
缓存时间: 2026/06/11 19:41
无论你是GPU资源紧张还是富足,今天发布的PyLate都能满足你的需求!
GPU发烧友:MaxSim内核可大幅加速训练,同时降低内存需求
CPU爱好者:TACHIOM让你直接在CPU上实现闪电般快速的多向量索引与搜索 https://t.co/GJ3HGtWZws
相似文章
在@huggingface上发布我的第一个内核:MaxSim后期交互检索(ColBERT / PyLate)的瓶颈在于材料……
在 Hugging Face 上发布了一个内核,通过使用分块评分和 SIMD 组矩阵运算(Metal 和 WMMA)来加速 MaxSim 后期交互检索,比朴素实现获得了 3–5 倍的加速。
@raphaelsrty:在GPU上计算最大相似度(ColBERT、ColPali的评分步骤)可以被优化,这正是@tonywu_71所做的。我……
Tony Wu发布了late-interaction-kernels (LIK):用于MaxSim的融合Triton内核,MaxSim是ColBERT和ColPali背后的评分步骤,已集成到PyLate和colpali-engine中,提供了内存效率和性能提升。
@cosimorulli1: 很高兴分享我们的最新工作 TACHIOM 已集成到 PyLate 生态系统!https://arxiv.org/pdf/2604.2814…
TACHIOM,一个具有词元感知聚类和分层索引的多向量检索系统,已集成到 PyLate 生态系统中。与现有最先进系统相比,它在保持相当效果的同时,实现了高达 247 倍的聚类加速和 9.8 倍的检索加速。
@charles_irl: GPU 术语表新增文章:CuTe DSL、CUTLASS 和 CuTe——用于编写一些最高性能…
GPU 术语表新增文章,涵盖 CuTe DSL、CUTLASS 和 CuTe——这些工具用于在数据中心 GPU 上编写高性能 GPU 内核,并附有 Python 示例。
Block-sparse GPU kernels
OpenAI 发布 block-sparse GPU kernels,这是一款用于在 GPU 上进行高效稀疏矩阵乘法的工具,可以减少神经网络操作的计算量和内存占用。