标签
针对 ggml-org/llama.cpp 的一项 Pull Request 为 GLM-5.3-Flash(GLM5-Next)模型添加了推理支持,进一步扩展了该库对智谱 AI GLM 系列模型的覆盖范围。
这项工作将ggml的Metal内核集成到transformers库中,使GGUF模型能够直接运行,提升兼容性和性能,实现Mac上的快速本地推理。
laya.cpp 是一个优化的 C++ 实现,用于近即时决策,基于 ggml 构建并带有自定义 CUDA 内核,展示了在 Laya 模型上相比 Python 的显著速度提升。
NVIDIA 的文本转动作模型已通过 kimodo.cpp 移植到 CPU 上运行,无需 NVIDIA 的技术栈。kimodo.cpp 是一个开源的 GGML/C++ 实现,正迅速获得关注。
本文讨论了关于Hugging Face收购llama.cpp/ggml的担忧,探索了对人工智能生态系统的潜在风险,以及许可证保护和社区意见的问题。
llama.cpp/GGML 的 PR (26291) 将基于 RPC 的 300GB 模型加载速度提升了约 300%,在消费级硬件上通过 GGML_RPC_LOAD_THREADS 设置,将加载时间从约 5 分钟缩短至约 1.5 分钟。
LocalAI 解释了为什么它要编写自己的 C/C++ 推理后端,并展示了其 vllm.cpp 移植版本在多个模型和硬件上的基准测试中,能够实现与 vLLM 相当或更高的吞吐量,同时占用空间远小于 vLLM。
audio.cpp 0.4 版本为 Higgs Audio v3 TTS 4B(10倍实时)和 Fish Audio S2 Pro 添加了基于 C++/GGML 的推理,支持完整 GGUF 加载,并实现了 Q8 速度与显存优化。
audio.cpp中发布了基于C++/GGML实现的Supertonic 3、MOSS-TTS、IndexTTS2和Irodori-TTS,能够在RTX 5090上3分钟内生成10小时音频。
audio.cpp更新引入了流式支持和四个ASR/STT模型(Nemotron 3.5、Higgs Audio STT、VibeVoice ASR、Hviske ASR),采用原生C++/GGML实现,速度比Python快高达2.41倍,词错误率(WER)和显存占用具有竞争力。
audio.cpp发布重大更新,新增音乐/SFX生成和源分离功能,支持ACE-Step、HeartMuLa、Stable Audio 3和HTDemucs,在原生C++/GGML中实现长音乐生成高达10倍的实时速度。
VibeVoice 1.5B,一个长篇幅多说话人TTS模型,现已获得audio.cpp(原生C++/ggml运行时)的支持,在RTX 5090上实现4.08倍实时速度,比无量化的Python基线快2.86倍。
开发者改进了 qwen3-tts.cpp,使其在 RTX 5080 上实现 5 倍实时运行,并使用 Kotlin Compose Multiplatform 创建了跨平台桌面 GUI,具备语音克隆、流式传输和说话人嵌入管理功能。
audio.cpp是一个C++/ggml运行时,集成了包括Qwen3-TTS、PocketTTS和VeVo2在内的12种音频模型,在CUDA上实现TTS速度比Python快5倍。
测试表明,llama.cpp 默认的流水线并行浪费显存且无速度提升;通过编译时设置 GGML_SCHED_MAX_COPIES=1 可节省大量显存,同时保持相同推理速度。
parakeet.cpp 是一个快速、轻依赖的C++17推理管道,用于NVIDIA的NeMo Parakeet语音识别模型,基于ggml构建。它能实现与NeMo字节相同的转录结果,并在CPU和GPU上显著提升速度。
NVIDIA 的 Parakeet 语音转文本模型已被移植到纯 C++/ggml,实现了与 NeMo 字节完全相同的输出,GPU 上推理速度提升高达 5 倍,并提供量化的 GGUF 变体,无需 Python 或 PyTorch 即可在任何地方高效部署。
本文重点介绍了 llama.cpp/ggml 中的全新 WebGPU 后端,它能够在浏览器中实现 GPU 加速的本地 AI 模型推理,由 Reese Levine 及其在 USCS 的团队在过去一年半中开发完成。