我制作了一个离线、单文件的GPU构建选择器,用于估算一台设备能运行哪些本地模型以及以多少tok/s的速度运行
摘要
一位开发者创建了一个离线、单文件的GPU构建选择器,用于估算系统能运行哪些本地AI模型以及其token生成速度。
暂无内容
相似文章
在4GB笔记本GPU(RTX 3050 Ti)上的本地智能体工作空间:tok/s 以及小型模型在调用工具、构建制品和RAG时遇到的困难
作者在4GB RTX 3050 Ti笔记本GPU上对Bike4Mind工作空间内的本地Qwen模型进行了基准测试,发现采用Q4_K_M量化的2B模型是适配VRAM的最佳选择,达到了96 tok/s。较小的模型在工具选择、需要多个模型的制品生成以及导致模型切换开销的RAG嵌入方面存在困难。
@no_stp_on_snek: 运行本地模型的好硬件发现:两块GPU作为独立实例,优于通过PCIe用Tensor-Parallel连接在一起的那两块……
运行本地AI模型的硬件提示:将两块GPU作为独立实例使用比通过PCIe用Tensor-Parallel连接起来更快,后者比单独一张卡慢了23%。Tensor-Parallel仅对一张GPU无法容纳的模型有益。
@andrewchen:体验本地AI模型的主要缺点在于你会买一块GPU,然后另一块,接着又一块……
Andrew Chen分享了他为本地AI实验购买多块GPU的经历,在5090 eGPU上以100 tok/s运行Qwen3.6 27B密集模型,并将其与Sonnet 4.6进行比较。
打造了一款能准确告诉你哪些LLMs适合你的GPU的工具。欢迎反馈。
一款估算哪些LLMs适合用户GPU内存的工具,根据性能对模型进行排名,同时考虑内存限制和量化级别。
我制作了一个工具,将小型本地模型与大型编码模型串联,并在两者之间自动卸载显存
一位开发者制作了一个工具,将小型本地模型与大型编码模型串联,并在两者之间自动卸载显存以优化内存使用。