我们开源了Paddock,我们的Rust/C++推理引擎,自带CUDA内核(MIT/Apache-2.0)
摘要
Paddock是一个开源的Rust/C++推理引擎,带有自定义CUDA内核,在基准测试中展示了与vLLM和SGLang相竞争的性能,同时支持OpenAI/Anthropic风格的API和GGUF/safetensors格式。
我是开发者之一。我们八月份说过九月份会开源,它确实昨晚开源了。MIT或Apache-2.0,任选其一。你看到的仓库是我们的内部仓库,包含内核,因此从现在起一切都在公开进行。这是一个用Rust和C++编写的推理引擎,带有我们自己的CUDA内核。一个二进制文件支持OpenAI和Anthropic风格的API,加载GGUF和safetensors格式。我们每年在工作中通过它处理约3000亿个令牌。一些数据:在单个RTX PRO 6000上运行Qwen3.8-27B FP8,所有引擎关闭spec decoding:与vLLM相比,在13项测试中有13项更快,快1.02倍到1.19倍(所以不是很大);与SGLang相比,在13项测试中有10项更快,2项落后,1项持平;与llama.cpp Q8_0相比,在13项测试中有13项更快,快1.5倍到37倍。32个客户端,输入输出各1024令牌:1062 tok/s,vLLM为958,SGLang为844。完整结果(包含损失):https://truespar.com/paddock/benchmarks/qwen38-27b 目前不支持的功能:仅CUDA,Windows和Linux。已在Blackwell(5090、RTX PRO 4500/5000/6000、B200)和Ampere(A6000是启动卡,30系列可用)上验证。Ada内核已发布,但无人在硬件上运行,因此除非设置PADDOCK_UNVALIDATED_ARCH=1,否则引擎拒绝启动。Hopper和A100内核在代码库中,但无硬件支持。不支持Mac、ROCm和Vulkan。每个GPU一个模型,不支持张量并行。https://github.com/truespar/paddock 感谢任何帮助和建议!
相似文章
构建一个媲美 Llama.cpp 的 Rust 推理引擎
Ferrox 是一个纯 Rust 推理引擎,可加载 GGUF 模型,并在 CPU、Metal 或 CUDA 上运行本地 LLM,提供 CLI 和兼容 OpenAI 的服务器。它的目标是在不使用任何绑定、从零编写的情况下,达到与 llama.cpp 相当的性能。
GPU上的无畏并发:在Rust中进行安全的GPU推理,与vLLM/SGLang竞争 [R]
cuTile Rust 引入了一种基于块(tile)的编程模型,利用 Rust 的所有权机制来保证 GPU 内核的内存安全和无数据竞争,基于该模型构建的 Grout 推理引擎在 Qwen3 模型上实现了与 vLLM/SGLang 相当的吞吐量。
@SuJinYan123: https://github.com/openinfer-project/openinfer/pull/522… openinfer p/d 分离支持,based on store(pegaflow p2p) based p/d pull…
OpenInfer 0.2.0 发布,支持推测解码、p/d分离和GLM5.2 FP8推理;该项目是一个纯 Rust + CUDA 的 LLM 推理引擎,无需 PyTorch 等框架依赖。
@npashi: 终于可以谈谈过去6个月我在@nvidia一直埋头做的事了。我们刚刚开源了cuda-oxide——一个实验性…
NVIDIA 已开源 cuda-oxide,这是一个实验性的 rustc 后端,允许开发者直接用纯 Rust 编写 CUDA 内核,无需 DSL、FFI 或源码到源码的转换。
大规模LLM推理开放手册(GPU内部机制、KV缓存、批处理、vLLM/SGLang/TensorRT-LLM)[P]
一本正在编写中的开放手册,解释LLM推理内部机制,包括GPU内存层次结构、KV缓存、批处理以及vLLM和TensorRT-LLM等流行推理引擎。