Ornith-397B 在单张 RTX PRO 6000 Blackwell 96GB 上以 Q4 运行 - 预填充 2,354 tok/s,解码约 20–24 tok/s
摘要
Krasis 是一个专注于 MoE 的运行时,通过动态管理 VRAM 中的专家驻留,能够在一张 RTX PRO 6000 Blackwell 96GB GPU 上以约 20-24 tok/s 的解码速度运行 397B 参数的 Ornith 模型。
我一直在构建 Krasis,一个专注于 MoE 的运行时,用于在 NVIDIA 消费级/工作站 GPU 上通过有限的 VRAM 流式传输大型模型,我认为这是迄今为止最有趣的结果:Ornith-1.0-397B 在单张 GPU 上交互运行。
硬件:1× RTX PRO 6000 Blackwell 96GB + AMD EPYC 7742(64核,不过 CPU 与此运行关系不大),以及足够的 DDR4 系统内存以 Q4 格式将模型加载到 RAM 中。
模型显然无法塞进 96GB,Krasis 将专家参数保留在 CPU RAM 中,并动态管理哪些专家驻留在 VRAM 中(本次运行时约 43% 的路由专家驻留)。
峰值进程内存约为 202GB,因此运行它需要超过该数值,但使用消费级 DDR5 主板可以达到 256GB 内存。
测量数据(INT4 专家、HQQ4 注意力、4-bit KV):
- 10,000 token 预填充 1,346.3 tok/s:7.43 秒
- 39,920 token 预填充 2,354.5 tok/s:16.95 秒
- 50 token 解码 23.58 tok/s
- 100 token 解码 21.85 tok/s
- 250 token 持续解码 20.40 tok/s
- 使用 Krasis 自适应冷质量剪枝后,50 token 解码 25.73 tok/s(+9.1%),该剪枝跳过了低排名、非驻留的专家路由,同时在测量运行中平均仅省略了约 1.8% 的路由概率质量。
同样的运行时在一切可装入系统 RAM 时,也能更快地运行较小的 MoE(例如在 5090 上 35B 类模型约 117 tok/s 解码),而 Ornith-397B 甚至可以在单张 RTX 5090 32GB 上以约 7.9 tok/s 解码运行,如果你有耐心的话。
GitHub 仓库
速度基准
质量基准
乐意回答问题或运行大家好奇的特定提示/配置。
相似文章
Ornith-1.5-35B-A3B Q4 在 4070Ti 上运行速度达 60 tok/s。
一位用户报告在 NVIDIA RTX 4070 Ti 上使用 Ornith-1.5-35B-A3B MOE 模型达到了每秒 60 个令牌的速度,展示了高效的本地推理优化。
@DogukanUrker: Ornith-1.5-9B在单张RTX 3060上使用Q5量化:200k上下文约52 token/s,预填充约1700 token/s。占用11.8GB(共12GB),零CPU卸载。
这篇文章详细介绍了在RTX 3060上运行Ornith-1.5-9B AI模型,使用200k上下文,通过高级量化技术实现高速推理。
@sudoingX: 我之前在 llama.cpp 上用 Q4 量化运行了 Ornith 新型 35B MoE 模型,4 bit,体积小,速度快,达到了约 78 tok/s。然后我更换了引擎……
一款名为 Ornith 的 35B MoE 智能编码模型,在单台 DGX Spark 上以 FP8 精度近乎无损运行,支持 300 万 token 上下文,速度约 36 tok/s,预计通过投机解码可进一步提升性能。
RTX 3090 本地基准测试 - Qwen3.6 27b 对比 Ornith
用户在RTX 3090上使用inspect-ai运行本地基准测试,比较Qwen3.6 27b、Gemma4 26B和Ornith1.0 35B。结果显示Qwen在知识和编码方面领先,而Ornith在接地性和召回方面具有竞争力。
Ornith-1.0-35B Q3_K_M:约17 GB显存,经KLD与BF16对比验证
Ornith-1.0-35B Q3_K_M是一个35B参数模型的3位量化版本,需要约17 GB显存,并通过KLD与BF16对比检查以确保保真度。