标签
Google 分享开源向量化快速排序代码,通过利用 SIMD 指令实现比 C++ std::sort 快 10 倍的速度提升,提供在现代 CPU 架构上性能可移植的排序。
本文提出了一种利用二维高斯溅射与 Bézier 样条进行线条画矢量化的先进方法,该方法能生成高质量的矢量输出,并兼容用户输入与视频应用场景。
This technical blog post explains the performance impact of memory alignment in SIMD vectorization, covering architectures with strict alignment requirements, cacheline crossing, and the behavior of modern CPUs.
本文介绍了VectorizationLLM,这是一个基于Google开放权重模型和RAG知识库构建的专业LLM,旨在帮助学生使用MATLAB学习智能向量化、傅里叶分析和微分方程,而不直接提供答案。
QuestDB引入了一个专用的WINDOW JOIN运算符,该运算符经过并行化和向量化处理,在围绕事件时间戳的时间序列聚合中,相较于其他数据库实现了高达25倍的加速。
一篇博客文章,描述了一个微型编译器,演示了如何通过将for循环转换为带有通道和掩码的向量化循环来降低数据并行内核,实现代码约180行Python。
这篇博客分析了PivCo-Huffman论文,该论文引入了并行Huffman解码的“合并”操作,无需交错开销即可实现高效的向量化和GPU友好解码。
一篇博文,分析和实现了在AMD Zen 4上使用AVX-512指令的SIMD加速版本的std::copy_if,并进行了性能分析和与编译器自动向量化的对比。
本文探讨了在ARM处理器上使用SIMD指令进行字符匹配的最快方法,比较了传统的NEON方法与现代ARM芯片(如AWS Graviton4、Google Axion等)上可用的较新SVE2能力。