我们开源了Paddock,我们的Rust/C++推理引擎,自带CUDA内核(MIT/Apache-2.0)

Reddit r/LocalLLaMA 工具

摘要

Paddock是一个开源的Rust/C++推理引擎,带有自定义CUDA内核,在基准测试中展示了与vLLM和SGLang相竞争的性能,同时支持OpenAI/Anthropic风格的API和GGUF/safetensors格式。

我是开发者之一。我们八月份说过九月份会开源,它确实昨晚开源了。MIT或Apache-2.0,任选其一。你看到的仓库是我们的内部仓库,包含内核,因此从现在起一切都在公开进行。这是一个用Rust和C++编写的推理引擎,带有我们自己的CUDA内核。一个二进制文件支持OpenAI和Anthropic风格的API,加载GGUF和safetensors格式。我们每年在工作中通过它处理约3000亿个令牌。一些数据:在单个RTX PRO 6000上运行Qwen3.8-27B FP8,所有引擎关闭spec decoding:与vLLM相比,在13项测试中有13项更快,快1.02倍到1.19倍(所以不是很大);与SGLang相比,在13项测试中有10项更快,2项落后,1项持平;与llama.cpp Q8_0相比,在13项测试中有13项更快,快1.5倍到37倍。32个客户端,输入输出各1024令牌:1062 tok/s,vLLM为958,SGLang为844。完整结果(包含损失):https://truespar.com/paddock/benchmarks/qwen38-27b 目前不支持的功能:仅CUDA,Windows和Linux。已在Blackwell(5090、RTX PRO 4500/5000/6000、B200)和Ampere(A6000是启动卡,30系列可用)上验证。Ada内核已发布,但无人在硬件上运行,因此除非设置PADDOCK_UNVALIDATED_ARCH=1,否则引擎拒绝启动。Hopper和A100内核在代码库中,但无硬件支持。不支持Mac、ROCm和Vulkan。每个GPU一个模型,不支持张量并行。https://github.com/truespar/paddock 感谢任何帮助和建议!
查看原文

相似文章

构建一个媲美 Llama.cpp 的 Rust 推理引擎

Hacker News Top

Ferrox 是一个纯 Rust 推理引擎,可加载 GGUF 模型,并在 CPU、Metal 或 CUDA 上运行本地 LLM,提供 CLI 和兼容 OpenAI 的服务器。它的目标是在不使用任何绑定、从零编写的情况下,达到与 llama.cpp 相当的性能。