Llama.cpp:拆分模式张量修复即将到来?

Reddit r/LocalLLaMA 工具

摘要

Llama.cpp 预计将获得针对多 GPU 配置下拆分模式张量崩溃问题的修复,该问题目前每 90-120 分钟导致 VRAM 耗尽。据称,该修复还能带来约 35% 的吞吐量提升,优于分层模式。

看来他们一直在努力,我们可能很快就会看到针对拆分模式张量崩溃问题的修复。多 GPU 用户请保持关注——(在我的测试中,SM Tensor 在 TG 上比 Layer 模式有约 35% 的提升,但当然每 90-120 分钟会因显存耗尽而崩溃,而这个修复应该能解决这个问题)[https://github.com/ggml-org/llama.cpp/pull/22616](https://github.com/ggml-org/llama.cpp/pull/22616)
查看原文

相似文章

双GPU llama.cpp加速

Reddit r/LocalLLaMA

llama.cpp的一个分支修复了量化KV缓存中的--split-mode tensor问题,在双GPU配置上实现高达40%的速度提升,且无质量损失。

llama.cpp b9966 针对 sm-tensor

Reddit r/LocalLLaMA

llama.cpp b9966 引入了一个针对 -sm tensor 模式的修复,该修复缓存了正则表达式模式,消除了解码线程中每个张量每个标记的 29 次重新编译,从而显著减少了 CPU 开销。