Llama.cpp:拆分模式张量修复即将到来?
摘要
Llama.cpp 预计将获得针对多 GPU 配置下拆分模式张量崩溃问题的修复,该问题目前每 90-120 分钟导致 VRAM 耗尽。据称,该修复还能带来约 35% 的吞吐量提升,优于分层模式。
看来他们一直在努力,我们可能很快就会看到针对拆分模式张量崩溃问题的修复。多 GPU 用户请保持关注——(在我的测试中,SM Tensor 在 TG 上比 Layer 模式有约 35% 的提升,但当然每 90-120 分钟会因显存耗尽而崩溃,而这个修复应该能解决这个问题)[https://github.com/ggml-org/llama.cpp/pull/22616](https://github.com/ggml-org/llama.cpp/pull/22616)
相似文章
双GPU llama.cpp加速
llama.cpp的一个分支修复了量化KV缓存中的--split-mode tensor问题,在双GPU配置上实现高达40%的速度提升,且无质量损失。
ICYM: llama.cpp b9455 --SM Tensor KV 缓存修复已合并
llama.cpp 版本 b9455 合并了一个针对多 GPU 设置中 `-sm tensor` KV 缓存量化的修复,解决了展平张量时形状信息丢失的问题。
@analogalok:别再盲目信任本地 LLM 的默认多 GPU 设置了,你实际上正浪费 25% 的性能……
基准测试结果对比了 llama.cpp 中针对双 GPU 设置的层并行与张量并行:层模式在预填充(RAG 管道)中快 25%,而张量模式在解码(交互式聊天)中快 16%。
一个 llama.cpp PR 在 GPU 上缓存“热”MoE 专家 — 8GB VRAM 下报告 33 → 56 tok/s
一个 llama.cpp PR 增加了基于热力图的“热”MoE 专家 GPU 缓存,在 8GB VRAM 下对某些模型将 tok/s 提升了约 1.7-2 倍,但对其他模型结果不一。
llama.cpp b9966 针对 sm-tensor
llama.cpp b9966 引入了一个针对 -sm tensor 模式的修复,该修复缓存了正则表达式模式,消除了解码线程中每个张量每个标记的 29 次重新编译,从而显著减少了 CPU 开销。