Ornith-1.5-35B-A3B Q4 在 4070Ti 上运行速度达 60 tok/s。
摘要
一位用户报告在 NVIDIA RTX 4070 Ti 上使用 Ornith-1.5-35B-A3B MOE 模型达到了每秒 60 个令牌的速度,展示了高效的本地推理优化。
并非每个人都有闲置资金来构建小型数据中心,因此我为这些'小玩家'发布了这篇帖子,因为我对这个35B MOE模型的性能和结果感到非常惊讶。上下文空间确实有限,会被大玩家们嘲笑。我试图想出一些鼓舞人心的话,但失败了,所以你们只能被嘲笑了。抱歉。
这里的想法是将尽可能多的活跃专家模型加载到显存中,其余部分卸载到系统内存中。在27个活跃专家时,它留下了约1GB的开销用于KV缓存,*目前*还没有溢出。
硬件组件规格
GPU NVIDIA RTX 4070 Ti — 12 GB GDDR6X
CPU Intel i9-13900KF(8个性能核心 + 16个能效核心,24C / 32T)
RAM 32 GB DDR5-6000
操作系统 Windows 11
运行时 llama.cpp build b10470, CUDA 12.4(预构建Windows二进制文件)
驱动程序 566.xx(2025年12月)
模型
模型 ornith-ai/Ornith-1.5-35B-A3B-GGUF
量化 Q4_K_M(总权重约20 GB)
架构 qwen3_5_moe — 混合专家模型,36B总参数中约3B活跃
类型 推理模型(输出 块),多模态
上下文 32,768(原生256K,可YaRN扩展)
启动命令(Windows .bat)
bat llama-server -hf ornith-ai/Ornith-1.5-35B-A3B-GGUF:Q4_K_M --no-mmproj -ngl 99 --n-cpu-moe 28 --load-mode none -c 32768 --parallel 1 -fa on --cache-type-k q8_0 --cache-type-v q8_0 --spec-type draft-mtp --spec-draft-n-max 2 -t 8 --jinja --reasoning-format auto --temp 0.6 --top-p 0.95 --top-k 20
Aquarium 提示示例
指标 值
预填充/提示处理 ~650–700 tok/s
生成,持续 ~50–56 tok/s
MTP 草稿接受率 ~42–48%(平均草稿长度 ~1.9)
llama-bench(隔离,小上下文,无KV增长)
n_cpu_moe tg128 (gen) pp2048 (prefill)
26 64.9 ± 0.2 t/s 571 ± 23 t/s
27 64.3 ± 0.4 t/s 482 ± 26 t/s
28 62.6 ± 0.2 t/s 461 ± 31 t/s
相似文章
Ornith-397B 在单张 RTX PRO 6000 Blackwell 96GB 上以 Q4 运行 - 预填充 2,354 tok/s,解码约 20–24 tok/s
Krasis 是一个专注于 MoE 的运行时,通过动态管理 VRAM 中的专家驻留,能够在一张 RTX PRO 6000 Blackwell 96GB GPU 上以约 20-24 tok/s 的解码速度运行 397B 参数的 Ornith 模型。
@ItsmeAjayKV:快速更新:我在3090上试用了Ornith-1.0-35B-Q5_K_M,感受复杂。好的方面:速度确实很快。我测…
用户在一张RTX 3090上测试了Ornith-1.0-35B,发现其推理速度较快(提示处理1560 tok/s,生成约78 tok/s),但在Three.js任务上的编码表现始终不如Qwen 3.6,即使多次尝试也是如此。
@sudoingX: 我之前在 llama.cpp 上用 Q4 量化运行了 Ornith 新型 35B MoE 模型,4 bit,体积小,速度快,达到了约 78 tok/s。然后我更换了引擎……
一款名为 Ornith 的 35B MoE 智能编码模型,在单台 DGX Spark 上以 FP8 精度近乎无损运行,支持 300 万 token 上下文,速度约 36 tok/s,预计通过投机解码可进一步提升性能。
4090 + 5060 Ti + 64GB RAM:35B-A3B 达 206 t/s,122B 达 37 t/s
一位用户分享了在双 GPU(RTX 4090 和 RTX 5060 Ti)上运行大语言模型(Qwen 27B-122B)的基准测试结果,实现了极高的 token 生成速度(例如 35B-A3B 达到 206 t/s,122B 达到 37-41 t/s)。帖子包含配置详情以及指向 GitHub 仓库的链接,其中包含脚本和原始数据。
RTX 3090 本地基准测试 - Qwen3.6 27b 对比 Ornith
用户在RTX 3090上使用inspect-ai运行本地基准测试,比较Qwen3.6 27b、Gemma4 26B和Ornith1.0 35B。结果显示Qwen在知识和编码方面领先,而Ornith在接地性和召回方面具有竞争力。