llama.cpp 更新 - granite-speech-4.1-2b, LFM2.5-ColBERT/Embedding-350M, Vulkan 后端相关变更及其他事项
摘要
llama.cpp 新增对 granite-speech-4.1-2b 和 LFM 嵌入模型的支持,引入了多项 Vulkan 后端增强功能(例如 CONV_3D、规范常量、溢出修复),并包含 UI/UX 改进和其他修复。
支持模型:granite-speech-4.1-2b-plus by 24818 LFM2.5-ColBERT-350M & LFM2.5-Embedding-350M by 24913 Vulkan:vulkan: 在启用 GGML_VULKAN_CHECK_RESULTS / RUN_TESTS 时链接 ggml-cpu #24444 vulkan: 将 mul_mm ALIGNED 设为规范常量 #24689 vulkan: 支持 CONV_3D #24612 vulkan: 支持 GET_ROWS_BACK #24883 vulkan: 支持所有后端测试(包括 SQR/SQRT/SIN/COS/CLAMP/LEAKY_RELU/NORM) #24582 vulkan: 在 FA 的 softmax 之前应用偏置以避免溢出 #24909 其他: UI: 新 Logo + 导航清理及移动端 UI/UX 改进 #24897 以及其他修复等。希望 Vulkan 列表能在 pp/tg 方面带来一些提升(专家可以告知我们)。不想为这些模型发布多个帖子,因此将所有其他项目包含在此单一帖子中。
相似文章
llama : 网站 + 统一的 `llama` 二进制文件 · ggml-org/llama.cpp · 讨论 #23875
Llama.cpp 宣布推出新网站和统一的 'llama' 二进制文件,以简化 LLM 推理,同时还包括 Hugging Face 缓存迁移和多模态支持等更新。
模型:Granite4 Vision,作者 gabe-l-hart · 拉取请求 #23545 · ggml-org/llama.cpp
此拉取请求为 llama.cpp(一个开源 LLM 推理引擎)增加了对 Granite4 Vision 模型的支持。
llama.cpp 里程碑
llama.cpp 发布里程碑版本,该开源库可在消费级硬件上本地运行大型语言模型,本次更新提升了性能或增加了新功能。
ggml-org/llama.cpp
llama.cpp 是一个开源 C/C++ 库,用于在本地硬件上高效运行 LLM 推理,支持多种量化方法和多后端(CPU、GPU 等)。
llama.cpp B9387 重大 AMD/ROCm PP 更新
llama.cpp 版本 b9387 引入了对 AMD CDNA 架构(MI100、MI200、MI300 系列)的 MFMA 支持,提升了数据中心 AMD GPU 上的处理流程性能。