simd

标签

Cards List
#simd

改进 std::simd::swizzle_dyn

Lobsters Hottest · 23小时前 缓存

对 Rust 的 std::simd::swizzle_dyn 实现的详细分析,揭示了性能缺陷并提出了优化方案,以更好地利用硬件 shuffle 指令。

0 人收藏 0 人点赞
#simd

每个人都应该了解SIMD

Hacker News Top · 2天前 缓存

Mitchell Hashimoto的一篇博文,认为SIMD(单指令多数据)比通常认为的要简单,并通过Zig示例演示了在循环中使用SIMD的常见模式。

0 人收藏 0 人点赞
#simd

SIMD用于碰撞检测

Lobsters Hottest · 2天前 缓存

这篇文章讨论了如何使用SIMD优化Box3D中凸包的碰撞检测,特别是利用宽SIMD和分离轴测试来提高具有多条边的凸包的性能。

0 人收藏 0 人点赞
#simd

Gigatoken: 一个新的开源分词器,比Tiktoken快约100倍,比Huggingface快500-1000倍

Reddit r/LocalLLaMA · 2天前 缓存

Gigatoken 是一个开源分词器,通过SIMD和缓存优化,相对于HuggingFace分词器实现了高达1000倍的加速,相对于Tiktoken实现了100倍加速。它支持作为现有分词器API的直接替代。

0 人收藏 0 人点赞
#simd

为什么是 l(k 和 q 的新运行时)

Lobsters Hottest · 3天前 缓存

K 和 Q 编程语言的新运行时,利用 SIMD、并行、融合和压缩技术重新构想执行方式,以更好地发挥现代硬件的性能。

0 人收藏 0 人点赞
#simd

如何在8位字节中打包三进制数

Hacker News Top · 2026-07-14 缓存

一篇博客文章,描述了一种高效的方法,使用SIMD友好的解包将三进制数打包到8位字节中,实现了每trit 1.6比特,并应用于LLM权重量化如BitNet b1.58。

0 人收藏 0 人点赞
#simd

通过一个“无用”的if语句将代码性能提升四倍

Lobsters Hottest · 2026-07-13 缓存

一篇博客文章展示了添加一个看似无用的条件检查如何通过允许CPU的分支预测器消除数据依赖,从而显著提升循环性能,在特定的压缩算法中实现了高达4倍的加速。

0 人收藏 0 人点赞
#simd

Talos-XII: 用 Rust 手写自动求导 + 小型 RL/MLP 堆栈,应用于抽卡概率建模(不使用 tch-rs/ndarray/PyTorch)——寻求 ARM/AVX-512/GPU 上的基准测试帮助 [P]

Reddit r/MachineLearning · 2026-07-09

Talos-XII 是一个专为《明日方舟:终末地》抽卡系统设计的命令行模拟器,完全用 Rust 构建,带有自定义自动求导引擎和小型 RL/MLP 堆栈(无外部机器学习框架)。它使用神经网络进行环境建模和抽卡决策策略,并包含复杂的 SIMD 调度和一个名为 ACHF 的自适应缓存开放实验。

0 人收藏 0 人点赞
#simd

l: 用于 k 和 q 的新运行时

Hacker News Top · 2026-07-07 缓存

l 是一个用于 k4、q 和 qSQL 的新运行时,提供透明的 SIMD、压缩向量和自动并行性,同时保持与现有代码的完全兼容。它针对华尔街的高性能计算。

0 人收藏 0 人点赞
#simd

在4 GB的数据堆中找针:Go语言性能从0.75 GB/s提升到49 GB/s

Lobsters Hottest · 2026-07-07 缓存

一位开发者详细介绍了将Go文件搜索从0.75 GB/s优化到49 GB/s的过程,利用SIMD等技术并理解内存层次结构,包括Go 1.26新推出的`simd/archsimd`包。

0 人收藏 0 人点赞
#simd

@Shanshrew: 一年研究即将结束。8个月未见成果,两次几乎放弃。去年11月/12月…

X AI KOLs Following · 2026-07-06 缓存

经过一年的研究,一个针对所有现代JavaScript解析器的通用2倍性能提升正在实施中,从oxc_parser开始,这将加速像OXLint、Vite和Deno这样的工具,并可能加速主要浏览器引擎。

0 人收藏 0 人点赞
#simd

用于C语言的单头文件解析器组合子

Hacker News Top · 2026-07-01 缓存

CParseC 是一个基于 C99 的单头文件解析器组合子库,灵感来自 Haskell 的 Parsec,提供零拷贝解析、无隐藏内存分配以及 SIMD 优化的组合子。其目标是提供一种灵活、高性能的手写解析器和 lex/yacc 工具的替代方案。

0 人收藏 0 人点赞
#simd

数据并行内核的微型编译器

Hacker News Top · 2026-06-25 缓存

一篇博客文章,描述了一个微型编译器,演示了如何通过将for循环转换为带有通道和掩码的向量化循环来降低数据并行内核,实现代码约180行Python。

0 人收藏 0 人点赞
#simd

@shubh6200: 要了解如何处理海量文件,请阅读 @geofflangdale 和 @lemir 的《Parsing Gigabytes of JSON per Second》…

X AI KOLs Timeline · 2026-06-24 缓存

该论文介绍了 simdjson,这是第一个能够在单核上使用 SIMD 指令每秒处理数 GB 数据的验证性 JSON 解析器,相比 RapidJSON 等现有解析器实现了显著的加速。

0 人收藏 0 人点赞
#simd

Rust 中的安全 SIMD,即使内部也安全

Lobsters Hottest · 2026-06-20 缓存

Rust 的 SIMD 抽象现在允许在不使用 unsafe 代码的情况下安全使用,这得益于 Rust 1.87 引入的 CPU 特性令牌,从而实现了简洁且可移植的向量操作。

0 人收藏 0 人点赞
#simd

@Modular: 两条路径为游戏场域提供支持。一条通过SIMD预计算场域。另一条将Mojo内核编译为WebAssembly…

X AI KOLs Following · 2026-06-15

Modular展示了两种计算游戏场域的方法:使用SIMD预计算,或将Mojo内核编译为WebAssembly以实现浏览器实时渲染。

0 人收藏 0 人点赞
#simd

@Modular: 一个 Mojo 程序每次使用 8 条 SIMD 通道生成独特的关卡,表示 GPU 的热场。热量产生大…

X AI KOLs Following · 2026-06-15

一个 Mojo 程序使用 8 条 SIMD 通道,基于 GPU 热场生成游戏关卡,热量制造障碍,冷却液增加加速效果。

0 人收藏 0 人点赞
#simd

Clojure 速度几乎媲美 C(需借助一些优化)

Lobsters Hottest · 2026-06-15 缓存

本文详细介绍了 Clojure 如何借助 JVM 的 Vector API 和精心优化,在 3D 压力测试中达到接近 C 的帧率(仅差 20%),展示了动态语言在热循环中也能接近底层性能。

0 人收藏 0 人点赞
#simd

PivCo-Huffman

Lobsters Hottest · 2026-06-05 缓存

本文介绍了PivCo-Huffman,一种利用小波树中的枢轴编码进行霍夫曼编码的新方法,实现了高性能的SIMD友好编码和解码。它始终优于最先进的霍夫曼编解码器,并展示了如何将ANS编码选择性地应用于偏斜节点,以接近ANS压缩比,同时保持高解压缩速度。

0 人收藏 0 人点赞
#simd

使用SIMD加速std::copy_if

Lobsters Hottest · 2026-05-26 缓存

一篇博文,分析和实现了在AMD Zen 4上使用AVX-512指令的SIMD加速版本的std::copy_if,并进行了性能分析和与编译器自动向量化的对比。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈