PSA:如果您几天未更新Llama.cpp,发现MTP性能不佳,请更新Llama.cpp。
摘要
更新Llama.cpp可获得显著的token生成速度提升,最高达1.5-1.8倍,并改善提示处理。
我之前以为它的性能很差,完全是个雷声大雨点小的东西,还花了好几个小时做基准测试。昨天更新后,token生成速度提升了大约1.5-1.8倍。他们甚至基本修复了pp问题。现在我的pp真的很大了 ;)
相似文章
PSA:llama.cpp 现在默认加载任何 draft-mtp 架构的 MTP 张量,即使 MTP 被禁用
最新版本的 llama.cpp 现在会自动为 draft-mtp 架构加载 MTP 张量,即使未启用推测解码,这可能会增加其 GGUF 文件中捆绑了 MTP 块的用户的显存使用量。
b9200 发布 - 潜在 MTP 提示处理速度提升
llama.cpp 版本 b9200 通过避免不必要的 logits 复制,减少了内存流量,从而提升了多令牌预测(MTP)的提示处理速度。
llamacpp有一个新的PR,声称使用rocm可将提示处理速度提升约15%,同时修复了一个bug,使Q2_K的速度提升了28倍
llama.cpp的一个新PR将ROCm上的提示处理速度提升了约15%,并修复了一个bug,使Q2_K量化速度提升了28倍。
构建9254修复了我的TG回归问题,并为NVIDIA GPU添加了PDL支持
llama.cpp的构建9254修复了一个token生成回归问题,并添加了对NVIDIA GPU的PDL(程序化依赖启动)支持,在新硬件上token生成速度提升高达10%。
移除MTP中的填充和多重D2D拷贝 - 由gaugarg-nv提交 · 拉取请求#24086 · ggml-org/llama.cpp
一个针对 llama.cpp 的拉取请求,移除了多令牌预测 (MTP) 中的填充和多重设备到设备拷贝,提高了 GPU 上的性能。