@DogukanUrker: Ornith-1.5-9B在单张RTX 3060上使用Q5量化:200k上下文约52 token/s,预填充约1700 token/s。占用11.8GB(共12GB),零CPU卸载。
摘要
这篇文章详细介绍了在RTX 3060上运行Ornith-1.5-9B AI模型,使用200k上下文,通过高级量化技术实现高速推理。
查看缓存全文
缓存时间: 2026/08/21 13:09
在单张RTX 3060上运行Q5量化版Ornith-1.5-9B:可处理200k上下文,生成速度约52令牌/秒,预填充速度约1700令牌/秒。占用12GB显存中的11.8GB,完全无需CPU卸载。(配置详见下方)
该模型共32层,其中8层携带键值缓存,其余24层采用固定循环状态。这正是其能在权重文件旁以f16格式容纳200k上下文的关键——无需使用量化缓存。
采用@atomic_chat_hq的AD-Q5_K-Q4_K量化方案,体积仅5.93GB:相比标准Q5_K_M体积更小,且在同等体积下具有更低的KL散度(0.0255对比0.0299)。
@ornith_的35B模型表现更优——若您拥有16GB内存且接受混合专家模型的卸载机制,建议直接选用该版本。当前配置专为希望将完整模型保留在显卡内、同时避免占用系统内存的用户设计。(35B模型配置详见评论区)
llama-server -m Ornith-1.5-9B-AD-Q5_K-Q4_K.gguf -ngl 99 -c 200000 -fa on –jinja -np 1 –temp 0.6 –top-p 0.95 –top-k 20 –min-p 0.0 –presence-penalty 0.0 –repeat-penalty 1.0 –reasoning on –reasoning-format none
相似文章
Ornith-1.5-35B-A3B Q4 在 4070Ti 上运行速度达 60 tok/s。
一位用户报告在 NVIDIA RTX 4070 Ti 上使用 Ornith-1.5-35B-A3B MOE 模型达到了每秒 60 个令牌的速度,展示了高效的本地推理优化。
Ornith-397B 在单张 RTX PRO 6000 Blackwell 96GB 上以 Q4 运行 - 预填充 2,354 tok/s,解码约 20–24 tok/s
Krasis 是一个专注于 MoE 的运行时,通过动态管理 VRAM 中的专家驻留,能够在一张 RTX PRO 6000 Blackwell 96GB GPU 上以约 20-24 tok/s 的解码速度运行 397B 参数的 Ornith 模型。
@ItsmeAjayKV:快速更新:我在3090上试用了Ornith-1.0-35B-Q5_K_M,感受复杂。好的方面:速度确实很快。我测…
用户在一张RTX 3090上测试了Ornith-1.0-35B,发现其推理速度较快(提示处理1560 tok/s,生成约78 tok/s),但在Three.js任务上的编码表现始终不如Qwen 3.6,即使多次尝试也是如此。
RTX 3090 本地基准测试 - Qwen3.6 27b 对比 Ornith
用户在RTX 3090上使用inspect-ai运行本地基准测试,比较Qwen3.6 27b、Gemma4 26B和Ornith1.0 35B。结果显示Qwen在知识和编码方面领先,而Ornith在接地性和召回方面具有竞争力。
@DogukanUrker: 单张RTX 3060上运行Gemma 4 12B:完整262,144上下文,速度约100 tok/s。(配置如下)密集模型 -> MTP推测…
DogukanUrker演示了在单张RTX 3060上使用推测解码和KV缓存拆分运行Gemma 4 12B,拥有完整262,144上下文,速度约100 tok/s,实现了接近满GPU利用率且无需CPU卸载。