标签
本文介绍了一种优化方法,用于在 C# 中使用 AVX-512 SIMD 指令解析 IPv4 地址,通过利用 .NET 10 的掩码加载功能,在 UTF-16 字符串中实现高性能。
作者优化了BitNet三值模型在CPU上的矩阵乘法内核,单独测试实现了29倍加速,但发现模型是内存密集型,端到端仅提升6-10%。推理引擎已开源。
Manticore的KNN搜索通过两遍HNSW、批量距离计算、编译时距离特化和AVX-512支持,速度提升高达29%。
一篇博文,分析和实现了在AMD Zen 4上使用AVX-512指令的SIMD加速版本的std::copy_if,并进行了性能分析和与编译器自动向量化的对比。
planb-lpm是一个便携式、MIT许可的C++17库,使用线性化B+树和AVX-512 SIMD实现高效的IPv6最长前缀匹配(LPM),支持动态FIB、Python绑定,并针对真实BGP数据进行全面基准测试。