针对 RTX5090 与 Qwen3.8 27B 的最快推理引擎。速度是 ninfer 的两倍。单智能体编码场景可达 500+ tokens/s,最多 12 个智能体同时运行、800k 上下文时可达 2000+ tokens/s。智能 VRAM/内存/磁盘缓存管理、Loop Guard、精美 UI 等。

Reddit r/LocalLLaMA 工具

摘要

MegaCapybara 是一个针对 NVIDIA RTX 5090 优化的开源 LLM 推理引擎,支持 Qwen3.8-27B,单智能体可达 500+ tokens/s,多智能体并发最高 2000+ tokens/s,具备投机解码、共享上下文池和智能 VRAM/RAM/磁盘缓存管理。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/10/03 02:56

MegaCapybara

面向 NVIDIA GeForce RTX 5090 上的 Qwen3.8-27B 的最快推理引擎。单个 coding agent 最高可达 500 tokens/s,一整个团队并行运行时最高可达 2,000 tokens/s,支持 Windows 11 与 Linux。启动器会帮你完成配置,并在加载模型之前,展示每项设置在精度、速度和内存上的开销。

Windows 下载 · Linux 下载 · Hugging Face 上的模型 · 使用指南

十二个 coding agent 同时在一张 RTX 5090 上运行 Tiny 模型,速度约为 1,500 tokens/s。

相似文章