Tag
PRQ-KMeans is a post-hoc tokenization method that improves residual quantization for semantic identifiers by removing global-mean components, refining centroids, and using projection residuals, achieving significant performance gains in industrial search and public recommendation benchmarks.
Flash-KMeans is an IO-aware implementation of exact KMeans that redesigns the algorithm around modern GPU bottlenecks, achieving 33x speedup over cuML and 200x over FAISS by eliminating redundant memory reads and writes.
Shuo Yang and team release FlashLib, a GPU library that accelerates classical ML operators like KMeans, KNN, HDBSCAN, PCA, and t-SNE, claiming speedups up to 208x.