标签
作者为Rust的fearless_simd库实现了一个向量化FMA,从而提高了性能,并发现了Rust和musl libc标准库中的错误。
在AMD Zen 3上对FP32矩阵乘法优化的系统性探索,使用AVX2/FMA内联指令实现了85.30 GFLOPS(理论峰值的63.5%),超越了朴素实现56.5倍,并达到了优化库的性能水平。