Ornith-397B 在单张 RTX PRO 6000 Blackwell 96GB 上以 Q4 运行 - 预填充 2,354 tok/s,解码约 20–24 tok/s

Reddit r/LocalLLaMA 工具

摘要

Krasis 是一个专注于 MoE 的运行时,通过动态管理 VRAM 中的专家驻留,能够在一张 RTX PRO 6000 Blackwell 96GB GPU 上以约 20-24 tok/s 的解码速度运行 397B 参数的 Ornith 模型。

我一直在构建 Krasis,一个专注于 MoE 的运行时,用于在 NVIDIA 消费级/工作站 GPU 上通过有限的 VRAM 流式传输大型模型,我认为这是迄今为止最有趣的结果:Ornith-1.0-397B 在单张 GPU 上交互运行。 硬件:1× RTX PRO 6000 Blackwell 96GB + AMD EPYC 7742(64核,不过 CPU 与此运行关系不大),以及足够的 DDR4 系统内存以 Q4 格式将模型加载到 RAM 中。 模型显然无法塞进 96GB,Krasis 将专家参数保留在 CPU RAM 中,并动态管理哪些专家驻留在 VRAM 中(本次运行时约 43% 的路由专家驻留)。 峰值进程内存约为 202GB,因此运行它需要超过该数值,但使用消费级 DDR5 主板可以达到 256GB 内存。 测量数据(INT4 专家、HQQ4 注意力、4-bit KV): - 10,000 token 预填充 1,346.3 tok/s:7.43 秒 - 39,920 token 预填充 2,354.5 tok/s:16.95 秒 - 50 token 解码 23.58 tok/s - 100 token 解码 21.85 tok/s - 250 token 持续解码 20.40 tok/s - 使用 Krasis 自适应冷质量剪枝后,50 token 解码 25.73 tok/s(+9.1%),该剪枝跳过了低排名、非驻留的专家路由,同时在测量运行中平均仅省略了约 1.8% 的路由概率质量。 同样的运行时在一切可装入系统 RAM 时,也能更快地运行较小的 MoE(例如在 5090 上 35B 类模型约 117 tok/s 解码),而 Ornith-397B 甚至可以在单张 RTX 5090 32GB 上以约 7.9 tok/s 解码运行,如果你有耐心的话。 GitHub 仓库 速度基准 质量基准 乐意回答问题或运行大家好奇的特定提示/配置。
查看原文

相似文章

RTX 3090 本地基准测试 - Qwen3.6 27b 对比 Ornith

Reddit r/LocalLLaMA

用户在RTX 3090上使用inspect-ai运行本地基准测试,比较Qwen3.6 27b、Gemma4 26B和Ornith1.0 35B。结果显示Qwen在知识和编码方面领先,而Ornith在接地性和召回方面具有竞争力。