我受够了我那300GB模型在RPC上加载要5分钟。PR 26291 将其加速300%,降至1分30秒(4060ti+ddr4)+(4060ti+ddr5)

Reddit r/LocalLLaMA 工具

摘要

llama.cpp/GGML 的 PR (26291) 将基于 RPC 的 300GB 模型加载速度提升了约 300%,在消费级硬件上通过 GGML_RPC_LOAD_THREADS 设置,将加载时间从约 5 分钟缩短至约 1.5 分钟。

- 在 b10173 上 - "state":"loading" 4分54秒。 - 使用此 PR 和 GGML_RPC_LOAD_THREADS 12 - "state":"loading" 1分38秒 该 PR 已接近就绪,如果想保留新的 GGML_RPC_LOAD_THREADS 变量,则需要更改文档... 希望他们能采纳,客户端方面已经解决,剩下的服务器工作可以让其他人接手。在这种规模下,将模型加载时间降到一分钟以内会很棒,而且这并不遥远。有点好笑的是,我是在一台垃圾配置的电脑上开发出来的;而测试它的人每小时支付的费用可能抵得上我整套设备的价格。但在主权AI战争中,我为那些用2-3台游戏PC运行的小人物编写代码。
查看原文

相似文章