针对 RTX5090 与 Qwen3.8 27B 的最快推理引擎。速度是 ninfer 的两倍。单智能体编码场景可达 500+ tokens/s,最多 12 个智能体同时运行、800k 上下文时可达 2000+ tokens/s。智能 VRAM/内存/磁盘缓存管理、Loop Guard、精美 UI 等。
摘要
MegaCapybara 是一个针对 NVIDIA RTX 5090 优化的开源 LLM 推理引擎,支持 Qwen3.8-27B,单智能体可达 500+ tokens/s,多智能体并发最高 2000+ tokens/s,具备投机解码、共享上下文池和智能 VRAM/RAM/磁盘缓存管理。
查看缓存全文
缓存时间: 2026/10/03 02:56
MegaCapybara
面向 NVIDIA GeForce RTX 5090 上的 Qwen3.8-27B 的最快推理引擎。单个 coding agent 最高可达 500 tokens/s,一整个团队并行运行时最高可达 2,000 tokens/s,支持 Windows 11 与 Linux。启动器会帮你完成配置,并在加载模型之前,展示每项设置在精度、速度和内存上的开销。
Windows 下载 · Linux 下载 · Hugging Face 上的模型 · 使用指南
十二个 coding agent 同时在一张 RTX 5090 上运行 Tiny 模型,速度约为 1,500 tokens/s。
相似文章
@iotcoi:Qwen3.6-27B-FP8 + Dflash + DDTree,256k 上下文,10 个智能体,单颗 49W GB10 上峰值 200 tokens/s,平均解码 136 tokens/s
量化版 27B Qwen3.6 在单颗 49W GB10 GPU 上借助 Dflash+DDTree 优化,256k 上下文、10 智能体并发,峰值达 200 tok/s,平均 136 tok/s。
Qwen3.6 27B 在 RTX 5090 上,调整 MTP/缓存设置后的 6.4k 采样 token/s 分布
在 RTX 5090 上运行 Qwen3.6 27B,调整 MTP 和缓存设置后达到每秒 6.4k 个 token,展示了推理优化技术。
Qwen 3.6 27B 投机解码基准测试:单张 RTX 3090 上实现 ~100 TPS
一份详细的基准测试,比较了单张 RTX 3090 上 Qwen 3.6 27B 的投机解码引擎,显示 ik_llama 在代码生成中达到约每秒 100 个 token。结果包括 5 种引擎变体的解码 TPS、TTFT、显存占用和上下文退化情况。
Nifer 太疯狂了。在 Qwen 3.6 35B 上实现每秒 700 个 token(无思考模式)。专为 RTX 5090 打造。同时支持完整的 25 万上下文。
Nifer 是一款工具,能够在 Qwen 3.6 35B 上实现每秒 700 个 token 的推理(无思考模式),专为 RTX 5090 优化,并支持完整的 25 万上下文。
我将 Qwen3.8-27B 在 RTX 3090 上优化至单请求 99 tps 和批量请求 1150 tps
作者在 RTX 3090 GPU 上优化了 Qwen3.8-27B 模型的推理,通过各种量化和优化技术,实现了单请求高达 99 tps 和批量处理 1150 tps 的性能,并在 GitHub 上发布了更新的代码。