llama.cpp 的 auto fit 远比我想象的好用
摘要
llama.cpp 新增的 --fit 标志让超大模型也能在显存不足时高速运行,轻松突破显存限制,速度依旧惊人。
我一直以为 32 GB 显存最多只能跑 20 GB 左右的模型,比如 Qwen3.5 27B Q4 或 Q6。印象里只要模型塞不进显存,速度就会跌到 2 token/s。结果我大错特错。刚刚用 llama.cpp 测试了 Qwen3.6 Q8,上下文 256 k,开启 `\--fit\` 后,权重体积本身就超过显存,而我的 5090 还是通过 Oculink 连接的,却依旧能跑到 57 token/s!简直像魔法。如果你也和我一样以为“显存不够就完蛋”,现在立刻去试试!
相似文章
llama: 使用f16掩膜进行FA以节省VRAM(作者 am17an)· 拉取请求 #23764 · ggml-org/llama.cpp
此拉取请求针对llama.cpp推理引擎,实现了使用f16掩膜的Flash Attention以减少VRAM使用。
@Sumanth_077: 别再猜测哪些模型能塞进你的VRAM了!llmfit 是一款 CLI 工具,自动检测硬件,并对 206 个模型进行排名…
llmfit 是一个开源 CLI 工具,能检测你的硬件,并对 200 多个大语言模型进行排名,找出真正能在你系统上运行的模型,并自动选择最合适的量化级别。
在 Qwen 3.8 27B 上处理超过 100 万 token 后,以下是我针对 16GB 显存(73k 上下文长度,智能体编码场景)调校出的 llama.cpp 最佳配置。
本文分享了针对16GB显存、73k上下文窗口优化的llama.cpp配置方案,用于运行Qwen 3.8 27B模型,并通过实际软件工程项目展示了该配置在智能编码工作流中的性能表现。
首次运行本地模型
一位用户分享了在本地运行ik_llama模型的经历,尽管只有12GB显存,但仍称赞其速度很快。
一个 llama.cpp PR 在 GPU 上缓存“热”MoE 专家 — 8GB VRAM 下报告 33 → 56 tok/s
一个 llama.cpp PR 增加了基于热力图的“热”MoE 专家 GPU 缓存,在 8GB VRAM 下对某些模型将 tok/s 提升了约 1.7-2 倍,但对其他模型结果不一。