标签
Andree Toonk 发布了 Wireblast,这是一个使用 AF_XDP 编写的 Go 语言数据包生成器,可实现线速数据包传输。
SDL_gp 是一个为 SDL3 设计的最小化、高性能的2D图形绘制库,从 sokol_gp 移植而来,提供了简单的资源管理系统。
本文介绍了Phantom,一个借用Linux进程在高效离散事件网络仿真器中运行未经修改的应用程序的工具,展示了相较于Shadow和NS-3等现有工具的显著速度提升。
Ruf在古德伍德速度节上推出其全新B8水平对置八缸发动机,功率超过1000马力,并搭载于名为Erprober的改装CTR3测试车上。
QuixiAI 发布了 QuixiCore,这是一系列面向现代加速器的原生高性能 AI 内核库,为 CUDA、Metal、ROCm、XPU 和 Gaudi 后端提供了独立的实现,所有实现共享一个通用契约但没有共享代码。
Flow 是 C++11 的编程语言扩展,带来了基于 Actor 的并发,支持使用 future 和 promise 进行高效异步通信,并支持确定性模拟以进行可靠性测试。
Zalando 的工程团队描述了如何实现客户端负载均衡,以取代其高流量 Product Read API 的共享边缘负载均衡器。通过 Skipper 消除扇出瓶颈,从而降低延迟并提高可观测性。
audio.cpp是一个C++/ggml运行时,集成了包括Qwen3-TTS、PocketTTS和VeVo2在内的12种音频模型,在CUDA上实现TTS速度比Python快5倍。
TokenSpeed-Kernel是一个可移植、高性能的内核系统,用于LLM推理,实现零厂商特定模型代码,并支持多种GPU架构,在AMD MI355X上实现高达3.6倍的吞吐量提升。
该论文介绍了 simdjson,这是第一个能够在单核上使用 SIMD 指令每秒处理数 GB 数据的验证性 JSON 解析器,相比 RapidJSON 等现有解析器实现了显著的加速。
Ray Serve LLM 通过直接流式传输、新的 vLLM V2 执行器后端和 HAProxy 入口,在预填充和解码密集型工作负载上实现了4.4倍和24.8倍的吞吐量提升,现已在 Ray 2.56 中推出,与 Google Cloud 和 vLLM 合作。
Gemma 4被演示在浏览器中通过WebGPU以每秒255个token的速度运行,使用Fable 5生成的内核,展示了高效的设备端推理。
Sogen是一款高性能的用户空间模拟器,同时支持Windows和Linux环境。
zeroserve 现已支持 Caddy 兼容模式,通过将 Caddyfile 进行即时编译 (JIT) 为 eBPF 和原生机器码,实现了 3 倍吞吐量和 70% 延迟降低。
F1车队投入数百万美元用于驾驶员在环模拟器,这些模拟器具有超低延迟和高保真度,能够复制真实赛车的表现,让车手能够进行训练和开发调校。
mimalloc 是一个开源、高性能、可扩展的内存分配器,可作为 malloc 和 free 的直接替代品。它专为现代高并发应用和大内存规模而设计,被用于 Bing 等主要服务,并集成到 NoGIL CPython 和 Unreal Engine 等项目中。
GPU 术语表新增文章,涵盖 CuTe DSL、CUTLASS 和 CuTe——这些工具用于在数据中心 GPU 上编写高性能 GPU 内核,并附有 Python 示例。