Ornith-1.5-35B-A3B Q4 在 4070Ti 上运行速度达 60 tok/s。

Reddit r/LocalLLaMA 新闻

摘要

一位用户报告在 NVIDIA RTX 4070 Ti 上使用 Ornith-1.5-35B-A3B MOE 模型达到了每秒 60 个令牌的速度,展示了高效的本地推理优化。

并非每个人都有闲置资金来构建小型数据中心,因此我为这些'小玩家'发布了这篇帖子,因为我对这个35B MOE模型的性能和结果感到非常惊讶。上下文空间确实有限,会被大玩家们嘲笑。我试图想出一些鼓舞人心的话,但失败了,所以你们只能被嘲笑了。抱歉。 这里的想法是将尽可能多的活跃专家模型加载到显存中,其余部分卸载到系统内存中。在27个活跃专家时,它留下了约1GB的开销用于KV缓存,*目前*还没有溢出。 硬件组件规格 GPU NVIDIA RTX 4070 Ti — 12 GB GDDR6X CPU Intel i9-13900KF(8个性能核心 + 16个能效核心,24C / 32T) RAM 32 GB DDR5-6000 操作系统 Windows 11 运行时 llama.cpp build b10470, CUDA 12.4(预构建Windows二进制文件) 驱动程序 566.xx(2025年12月) 模型 模型 ornith-ai/Ornith-1.5-35B-A3B-GGUF 量化 Q4_K_M(总权重约20 GB) 架构 qwen3_5_moe — 混合专家模型,36B总参数中约3B活跃 类型 推理模型(输出 块),多模态 上下文 32,768(原生256K,可YaRN扩展) 启动命令(Windows .bat) bat llama-server -hf ornith-ai/Ornith-1.5-35B-A3B-GGUF:Q4_K_M --no-mmproj -ngl 99 --n-cpu-moe 28 --load-mode none -c 32768 --parallel 1 -fa on --cache-type-k q8_0 --cache-type-v q8_0 --spec-type draft-mtp --spec-draft-n-max 2 -t 8 --jinja --reasoning-format auto --temp 0.6 --top-p 0.95 --top-k 20 Aquarium 提示示例 指标 值 预填充/提示处理 ~650–700 tok/s 生成,持续 ~50–56 tok/s MTP 草稿接受率 ~42–48%(平均草稿长度 ~1.9) llama-bench(隔离,小上下文,无KV增长) n_cpu_moe tg128 (gen) pp2048 (prefill) 26 64.9 ± 0.2 t/s 571 ± 23 t/s 27 64.3 ± 0.4 t/s 482 ± 26 t/s 28 62.6 ± 0.2 t/s 461 ± 31 t/s
查看原文

相似文章

4090 + 5060 Ti + 64GB RAM:35B-A3B 达 206 t/s,122B 达 37 t/s

Reddit r/LocalLLaMA

一位用户分享了在双 GPU(RTX 4090 和 RTX 5060 Ti)上运行大语言模型(Qwen 27B-122B)的基准测试结果,实现了极高的 token 生成速度(例如 35B-A3B 达到 206 t/s,122B 达到 37-41 t/s)。帖子包含配置详情以及指向 GitHub 仓库的链接,其中包含脚本和原始数据。

RTX 3090 本地基准测试 - Qwen3.6 27b 对比 Ornith

Reddit r/LocalLLaMA

用户在RTX 3090上使用inspect-ai运行本地基准测试,比较Qwen3.6 27b、Gemma4 26B和Ornith1.0 35B。结果显示Qwen在知识和编码方面领先,而Ornith在接地性和召回方面具有竞争力。