标签
一篇深入的技术博客文章,解释如何使用现代x86_64 CPU上的SIMD指令高效地转置矩阵,重点介绍类似_mm256_shuffle_epi8的AVX2内联函数。
Bun.Image 是一个零依赖的可链式图像处理管道,用于解码、调整大小、旋转和重新编码 JPEG、PNG、WebP、HEIC 和 AVIF 格式,在后台线程运行,灵感来自 Sharp。
minc 是一种最小化的编程语言,可直接编译为多个平台的原生可执行文件,无需外部工具。它拥有现代语法、内置 SIMD 支持以及集成的着色器编译器。
文章批评了 C++26 中的新 std::simd 库,认为它比标量循环慢,编译速度慢,并且被自动向量化器和 Google Highway 等替代库超越,质疑其在经过十年标准化过程后的价值。
turbovec 是一个开源的 Rust 向量索引,使用 Google Research 的 TurboQuant 算法,实现了16倍压缩,搜索速度比 FAISS 更快,并且集成了 LangChain、LlamaIndex 和 Haystack 等 RAG 框架。
作者详细介绍了 bx 库跨平台 SIMD 抽象的第三次迭代,倡导无类型方法和 SSA 风格编码,以简化不同 CPU 架构上的底层性能优化。
planb-lpm是一个便携式、MIT许可的C++17库,使用线性化B+树和AVX-512 SIMD实现高效的IPv6最长前缀匹配(LPM),支持动态FIB、Python绑定,并针对真实BGP数据进行全面基准测试。
本文探讨了在ARM处理器上使用SIMD指令进行字符匹配的最快方法,比较了传统的NEON方法与现代ARM芯片(如AWS Graviton4、Google Axion等)上可用的较新SVE2能力。
turbovec 是一个基于 Rust 的向量索引,带有 Python 绑定,实现了谷歌的 TurboQuant 算法,提供高效的向量搜索,支持在线摄入,性能优于 FAISS,并具备过滤搜索能力。
该讲座介绍了GPU架构作为SIMD(向量/数组)处理器的灵活演化,讨论了数据并行性、存储体分组、体冲突、串行瓶颈以及SIMD指令历史(如MMX),强调GPU如何利用数据并行性并应对串行瓶颈。