首次运行本地模型
摘要
一位用户分享了在本地运行ik_llama模型的经历,尽管只有12GB显存,但仍称赞其速度很快。
可惜我只有12GB显存,但这个ik_llama速度非常快。
相似文章
本地LLM CPU用户……你们做任何事情要花多长时间?
关于在CPU上本地运行大语言模型性能的讨论,特别是大上下文尺寸的情况,以及显存限制带来的挑战。
在4GB笔记本GPU(RTX 3050 Ti)上的本地智能体工作空间:tok/s 以及小型模型在调用工具、构建制品和RAG时遇到的困难
作者在4GB RTX 3050 Ti笔记本GPU上对Bike4Mind工作空间内的本地Qwen模型进行了基准测试,发现采用Q4_K_M量化的2B模型是适配VRAM的最佳选择,达到了96 tok/s。较小的模型在工具选择、需要多个模型的制品生成以及导致模型切换开销的RAG嵌入方面存在困难。
@analogalok:我的8GB显存游戏本肯定会恨我这么做,但我还是做了。跑了一个31B稠密模型(Gemma 4…
用户在8GB显存的游戏本上,使用llama.cpp配合MTP推测解码,以约3 tokens/s的速度运行了Gemma 4 31B稠密模型,展示了在消费级硬件上运行31B稠密模型的可行性,并提出了智能体工作流程:快速MoE模型将困难任务路由给这个较慢的稠密模型。
@theemozilla: 我们正在努力改善 Hermes 中的本地模型体验,每个参数量级的最佳本地模型是什么?
用户询问针对不同 VRAM 级别(8-16GB、24-32GB、128GB)的最佳本地 AI 模型推荐,提到了 Gemma4、Qwen 和 DeepSeek 变体,因为他们正在改进 Hermes 中的本地模型支持。
llama.cpp 的 auto fit 远比我想象的好用
llama.cpp 新增的 --fit 标志让超大模型也能在显存不足时高速运行,轻松突破显存限制,速度依旧惊人。