标签
一篇技术博客文章,解释了 FastLanes 统一传输布局,这是一种面向 SIMD 的并行增量解码数据布局,以及它如何通过宽虚拟寄存器实现数据并行处理。
pgrust 0.2 rebuilds the Postgres query engine with batching, operator fusion, and SIMD, achieving 300x faster analytical queries and 30% faster OLTP than Postgres.
A Rust crate implementing Viterbi and Reed-Solomon forward error correction with SIMD acceleration, achieving faster throughput than the C library libfec on supported codecs.
对 Rust 的 std::simd::swizzle_dyn 实现的详细分析,揭示了性能缺陷并提出了优化方案,以更好地利用硬件 shuffle 指令。
Mitchell Hashimoto的一篇博文,认为SIMD(单指令多数据)比通常认为的要简单,并通过Zig示例演示了在循环中使用SIMD的常见模式。
Gigatoken 是一个开源分词器,通过SIMD和缓存优化,相对于HuggingFace分词器实现了高达1000倍的加速,相对于Tiktoken实现了100倍加速。它支持作为现有分词器API的直接替代。
一篇博客文章,描述了一种高效的方法,使用SIMD友好的解包将三进制数打包到8位字节中,实现了每trit 1.6比特,并应用于LLM权重量化如BitNet b1.58。
一篇博客文章展示了添加一个看似无用的条件检查如何通过允许CPU的分支预测器消除数据依赖,从而显著提升循环性能,在特定的压缩算法中实现了高达4倍的加速。
Talos-XII 是一个专为《明日方舟:终末地》抽卡系统设计的命令行模拟器,完全用 Rust 构建,带有自定义自动求导引擎和小型 RL/MLP 堆栈(无外部机器学习框架)。它使用神经网络进行环境建模和抽卡决策策略,并包含复杂的 SIMD 调度和一个名为 ACHF 的自适应缓存开放实验。
l 是一个用于 k4、q 和 qSQL 的新运行时,提供透明的 SIMD、压缩向量和自动并行性,同时保持与现有代码的完全兼容。它针对华尔街的高性能计算。
一位开发者详细介绍了将Go文件搜索从0.75 GB/s优化到49 GB/s的过程,利用SIMD等技术并理解内存层次结构,包括Go 1.26新推出的`simd/archsimd`包。
经过一年的研究,一个针对所有现代JavaScript解析器的通用2倍性能提升正在实施中,从oxc_parser开始,这将加速像OXLint、Vite和Deno这样的工具,并可能加速主要浏览器引擎。
CParseC 是一个基于 C99 的单头文件解析器组合子库,灵感来自 Haskell 的 Parsec,提供零拷贝解析、无隐藏内存分配以及 SIMD 优化的组合子。其目标是提供一种灵活、高性能的手写解析器和 lex/yacc 工具的替代方案。
一篇博客文章,描述了一个微型编译器,演示了如何通过将for循环转换为带有通道和掩码的向量化循环来降低数据并行内核,实现代码约180行Python。
该论文介绍了 simdjson,这是第一个能够在单核上使用 SIMD 指令每秒处理数 GB 数据的验证性 JSON 解析器,相比 RapidJSON 等现有解析器实现了显著的加速。
Rust 的 SIMD 抽象现在允许在不使用 unsafe 代码的情况下安全使用,这得益于 Rust 1.87 引入的 CPU 特性令牌,从而实现了简洁且可移植的向量操作。
Modular展示了两种计算游戏场域的方法:使用SIMD预计算,或将Mojo内核编译为WebAssembly以实现浏览器实时渲染。