我受够了我那300GB模型在RPC上加载要5分钟。PR 26291 将其加速300%,降至1分30秒(4060ti+ddr4)+(4060ti+ddr5)
摘要
llama.cpp/GGML 的 PR (26291) 将基于 RPC 的 300GB 模型加载速度提升了约 300%,在消费级硬件上通过 GGML_RPC_LOAD_THREADS 设置,将加载时间从约 5 分钟缩短至约 1.5 分钟。
- 在 b10173 上 - "state":"loading" 4分54秒。
- 使用此 PR 和 GGML_RPC_LOAD_THREADS 12 - "state":"loading" 1分38秒
该 PR 已接近就绪,如果想保留新的 GGML_RPC_LOAD_THREADS 变量,则需要更改文档... 希望他们能采纳,客户端方面已经解决,剩下的服务器工作可以让其他人接手。在这种规模下,将模型加载时间降到一分钟以内会很棒,而且这并不遥远。有点好笑的是,我是在一台垃圾配置的电脑上开发出来的;而测试它的人每小时支付的费用可能抵得上我整套设备的价格。但在主权AI战争中,我为那些用2-3台游戏PC运行的小人物编写代码。
相似文章
GLM-5.2 UD-IQ1_M 在 llama.cpp 上的运行 — 5090 + 3090 Ti 速度测试 (~ 579 t/s 预填充 @ 8k 上下文, ~324 t/s 预填充 @ 57k 上下文, ~10.6 t/s 解码)
GLM-5.2 在 llama.cpp 上使用 RTX 5090 和 RTX 3090 Ti 运行的速度测试结果,显示在 8k 上下文中预填充速度高达 579 t/s,解码速度约为 10.6 t/s。
在4台GB10上运行GLM 5.2,配备100G交换机,330k上下文,~25 tok/s解码,~650 tok/s预填充
本文详细介绍了在4台GB10的配置上,使用100G交换机运行GLM 5.2,在330k上下文下实现约25 tok/s解码和约650 tok/s预填充。内容包括硬件成本、使用Depth Prefill的性能基准测试,以及关于为更长上下文进行模型剪枝的说明。
16块AMD MI50 32GB:GLM-5.2 Q4 在 llama.cpp RPC 上以 12.2 tok/s 运行
描述了在由16块AMD MI50 GPU组成的集群上,使用llama.cpp的RPC以4位量化运行GLM-5.2模型,达到12.2令牌每秒的速度,并在10.7k上下文中实现了连贯的长文本生成。
llama.cpp 中的流水线并行可能浪费你的显存
测试表明,llama.cpp 默认的流水线并行浪费显存且无速度提升;通过编译时设置 GGML_SCHED_MAX_COPIES=1 可节省大量显存,同时保持相同推理速度。
一个 llama.cpp PR 在 GPU 上缓存“热”MoE 专家 — 8GB VRAM 下报告 33 → 56 tok/s
一个 llama.cpp PR 增加了基于热力图的“热”MoE 专家 GPU 缓存,在 8GB VRAM 下对某些模型将 tok/s 提升了约 1.7-2 倍,但对其他模型结果不一。