@Andy_ShuoYang:FlashLib 更新:我们现在支持基于 IVF-Flat 的 ANN 搜索——在真实向量工作负载上最高可比 cuVS 快 6.5 倍(…
摘要
FlashLib 更新,支持基于 IVF-Flat 的 ANN 搜索,在真实向量工作负载上性能比 cuVS 最高提升 6.5 倍。LEANN 现已集成 FlashLib 作为后端,在构建和搜索操作中带来显著加速。
查看缓存全文
缓存时间: 2026/06/05 05:11
FlashLib 更新:现在支持使用 IVF-Flat 进行 ANN 搜索 —— 在真实世界的向量工作负载(SIFT-1M)上,相比 cuVS 速度提升高达 6.5 倍,同时保持相同召回率。
LEANN 现已支持 FlashLib 作为后端:构建速度提升 26 倍,单查询速度提升 29 倍,批量搜索速度提升 298 倍。衷心感谢 @YichuanM 的帮助!
我们还开设了 Discord / Slack 频道 —— 欢迎加入,告诉我们你想看到的新算子,以及你希望 FlashLib 下一步支持的硬件后端!
Slack:https://join.slack.com/t/flashml/shared_invite/zt-3zpdh5j10-9dwTXrgLiqpVxizhA9KVbA…
Discord:https://discord.gg/ce5Xa5pf
相似文章
@Andy_ShuoYang: Flash-KMeans 只是一个开始。今天,Flash-KMeans 团队发布了 FlashLib——一个用于……的 GPU 库。
Flash-KMeans 团队发布了 FlashLib,这是一个面向经典机器学习算子的 GPU 库,在 Hopper GPU 上相比 cuML 可实现高达 208 倍的加速,专注于为智能体 AI 工作负载提供快速、可预测的性能。
@neural_avb: 深度学习兄弟姐妹们,别错过这个。你可以在嵌入空间中对数百万文档进行聚类,批量注释…
Shuo Yang 及其团队发布了 FlashLib,这是一个 GPU 库,可以加速 KMeans、KNN、HDBSCAN、PCA 和 t-SNE 等经典机器学习算子,声称加速比高达 208 倍。
面向可扩展向量架构的FlashAttention
FlashAttention-V引入了针对可扩展向量架构的分块FlashAttention优化,在CPU上的小型语言模型transformer推理中实现了高达42倍的加速,并识别了量化瓶颈。
@XAMTO_AI: 传统向量库把嵌入全存下来,百万文档很容易上百 GB。LEANN 换成精简图,检索时只给路过的节点现算向量。 论文和 README 里,大规模对比能省到约 97%,召回仍接近完整 HNSW。 适合放在自己笔记本上搜本地文件、邮件、浏览记录和…
LEANN 是一种新的向量索引方法,通过图精简和实时计算嵌入,将存储需求减少约97%,同时保持检索召回率接近完整HNSW,适合在笔记本电脑上使用,并在MLSys 2026上获得最佳论文奖。
我在llama.cpp中测试了最新合并的DFlash在Qwen 3.6 27B本地AI上的表现。36K上下文速度提升4.44倍。以下是我的发现(RTX 6000 PRO)。
一位用户在llama.cpp中测试了新合并的DFlash推测解码方法(Qwen 3.6 27B),在36K上下文下相比基准实现速度提升高达4.44倍,并附有详细的排行榜和质量测试。