@DogukanUrker: Ornith-1.5-9B在单张RTX 3060上使用Q5量化:200k上下文约52 token/s,预填充约1700 token/s。占用11.8GB(共12GB),零CPU卸载。

X AI KOLs Timeline 模型

摘要

这篇文章详细介绍了在RTX 3060上运行Ornith-1.5-9B AI模型,使用200k上下文,通过高级量化技术实现高速推理。

Ornith-1.5-9B在单张RTX 3060上使用Q5量化:200k上下文约52 token/s,预填充约1700 token/s。占用11.8GB(共12GB),零CPU卸载。(配置如下) 32层中,只有8层携带KV缓存,其余24层保持固定循环状态。这就是为什么200k上下文可以以f16格式与权重一起存储——不需要量化缓存。 量化使用的是@atomic_chat_hq的AD-Q5_K-Q4_K,大小为5.93GB:比原版Q5_K_M更小,同时KL散度更低,0.0255 vs 0.0299。 @ornith_的35B是更好的模型——如果你有16GB内存并且不介意MoE卸载,可以运行那个。这是针对希望所有内容都驻留在显卡上且系统内存不受影响的用户。(35B配置在回复中) llama-server -m Ornith-1.5-9B-AD-Q5_K-Q4_K.gguf -ngl 99 -c 200000 -fa on --jinja -np 1 --temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.0 --presence-penalty 0.0 --repeat-penalty 1.0 --reasoning on --reasoning-format none
查看原文
查看缓存全文

缓存时间: 2026/08/21 13:09

在单张RTX 3060上运行Q5量化版Ornith-1.5-9B:可处理200k上下文,生成速度约52令牌/秒,预填充速度约1700令牌/秒。占用12GB显存中的11.8GB,完全无需CPU卸载。(配置详见下方)

该模型共32层,其中8层携带键值缓存,其余24层采用固定循环状态。这正是其能在权重文件旁以f16格式容纳200k上下文的关键——无需使用量化缓存。

采用@atomic_chat_hq的AD-Q5_K-Q4_K量化方案,体积仅5.93GB:相比标准Q5_K_M体积更小,且在同等体积下具有更低的KL散度(0.0255对比0.0299)。

@ornith_的35B模型表现更优——若您拥有16GB内存且接受混合专家模型的卸载机制,建议直接选用该版本。当前配置专为希望将完整模型保留在显卡内、同时避免占用系统内存的用户设计。(35B模型配置详见评论区)

llama-server -m Ornith-1.5-9B-AD-Q5_K-Q4_K.gguf -ngl 99 -c 200000 -fa on –jinja -np 1 –temp 0.6 –top-p 0.95 –top-k 20 –min-p 0.0 –presence-penalty 0.0 –repeat-penalty 1.0 –reasoning on –reasoning-format none

相似文章

RTX 3090 本地基准测试 - Qwen3.6 27b 对比 Ornith

Reddit r/LocalLLaMA

用户在RTX 3090上使用inspect-ai运行本地基准测试,比较Qwen3.6 27b、Gemma4 26B和Ornith1.0 35B。结果显示Qwen在知识和编码方面领先,而Ornith在接地性和召回方面具有竞争力。