ggml

标签

Cards List
#ggml

为 GLM-5.3-Flash(GLM5-Next)添加支持 —— timkhronos · Pull Request #27773 · ggml-org/llama.cpp

Reddit r/LocalLLaMA ↗ · 4天前

针对 ggml-org/llama.cpp 的一项 Pull Request 为 GLM-5.3-Flash(GLM5-Next)模型添加了推理支持,进一步扩展了该库对智谱 AI GLM 系列模型的覆盖范围。

0 人收藏 0 人点赞
#ggml

@ggerganov: 直接使用transformers运行GGUF模型。这项工作将ggml的Metal内核引入transformers生态系统,提升兼容性和性能。

X AI KOLs Timeline ↗ · 2026-09-22 缓存

这项工作将ggml的Metal内核集成到transformers库中,使GGUF模型能够直接运行,提升兼容性和性能,实现Mac上的快速本地推理。

0 人收藏 0 人点赞
#ggml

laya.cpp: 优化的Laya近即时决策

Reddit r/LocalLLaMA ↗ · 2026-09-20

laya.cpp 是一个优化的 C++ 实现,用于近即时决策,基于 ggml 构建并带有自定义 CUDA 内核,展示了在 Laya 模型上相比 Python 的显著速度提升。

0 人收藏 0 人点赞
#ggml

@vicky_grok: 这太疯狂了!NVIDIA 的文本转动作模型现在无需 NVIDIA 的技术栈就能运行。输入一句话。获得人类动作。在……

X AI KOLs Timeline ↗ · 2026-08-29 缓存

NVIDIA 的文本转动作模型已通过 kimodo.cpp 移植到 CPU 上运行,无需 NVIDIA 的技术栈。kimodo.cpp 是一个开源的 GGML/C++ 实现,正迅速获得关注。

0 人收藏 0 人点赞
#ggml

关于Hugging Face收购事项的讨论..

Reddit r/LocalLLaMA ↗ · 2026-08-25

本文讨论了关于Hugging Face收购llama.cpp/ggml的担忧,探索了对人工智能生态系统的潜在风险,以及许可证保护和社区意见的问题。

0 人收藏 0 人点赞
#ggml

我受够了我那300GB模型在RPC上加载要5分钟。PR 26291 将其加速300%,降至1分30秒(4060ti+ddr4)+(4060ti+ddr5)

Reddit r/LocalLLaMA ↗ · 2026-08-08

llama.cpp/GGML 的 PR (26291) 将基于 RPC 的 300GB 模型加载速度提升了约 300%,在消费级硬件上通过 GGML_RPC_LOAD_THREADS 设置,将加载时间从约 5 分钟缩短至约 1.5 分钟。

0 人收藏 0 人点赞
#ggml

为什么我们要编写自己的C和C++推理引擎

Lobsters Hottest ↗ · 2026-07-31 缓存

LocalAI 解释了为什么它要编写自己的 C/C++ 推理后端,并展示了其 vllm.cpp 移植版本在多个模型和硬件上的基准测试中,能够实现与 vLLM 相当或更高的吞吐量,同时占用空间远小于 vLLM。

0 人收藏 0 人点赞
#ggml

[audio.cpp] 0.4 版本发布:Higgs Audio v3 TTS 4B(10倍实时)+ Fish Audio S2 Pro 基于 C++/GGML,完整 GGUF 加载,Q8 速度与显存优化

Reddit r/LocalLLaMA ↗ · 2026-07-24

audio.cpp 0.4 版本为 Higgs Audio v3 TTS 4B(10倍实时)和 Fish Audio S2 Pro 添加了基于 C++/GGML 的推理,支持完整 GGUF 加载,并实现了 Q8 速度与显存优化。

0 人收藏 0 人点赞
#ggml

[audio.cpp] 在RTX 5090上3分钟生成10小时音频(含演示)!基于C++/GGML的Supertonic 3、MOSS-TTS、IndexTTS2和Irodori-TTS发布

Reddit r/LocalLLaMA ↗ · 2026-07-15

audio.cpp中发布了基于C++/GGML实现的Supertonic 3、MOSS-TTS、IndexTTS2和Irodori-TTS,能够在RTX 5090上3分钟内生成10小时音频。

0 人收藏 0 人点赞
#ggml

@ggerganov:llama.cpp 的第10000次发布

X AI KOLs Timeline ↗ · 2026-07-14 缓存

庆祝 llama.cpp 的第10000次发布,这是一个用于本地运行大型语言模型的工具。

0 人收藏 0 人点赞
#ggml

[audio.cpp] 狐狸说什么:原生C++/GGML中的4个ASR模型(Nemotron 3.5 ASR、Higgs Audio STT、VibeVoice ASR和Hviske ASR),初始流式支持,327秒音频在2.17秒内转录完成。

Reddit r/LocalLLaMA ↗ · 2026-07-09

audio.cpp更新引入了流式支持和四个ASR/STT模型(Nemotron 3.5、Higgs Audio STT、VibeVoice ASR、Hviske ASR),采用原生C++/GGML实现,速度比Python快高达2.41倍,词错误率(WER)和显存占用具有竞争力。

0 人收藏 0 人点赞
#ggml

[audio.cpp] GGML之音——C++/GGML原生ACE-Step、Stable Audio、HeartMuLa、RoFormer、HTDemucs发布。60秒生成10分钟音乐!

Reddit r/LocalLLaMA ↗ · 2026-07-03

audio.cpp发布重大更新,新增音乐/SFX生成和源分离功能,支持ACE-Step、HeartMuLa、Stable Audio 3和HTDemucs,在原生C++/GGML中实现长音乐生成高达10倍的实时速度。

0 人收藏 0 人点赞
#ggml

[audio.cpp] VibeVoice 1.5B 发布 — 90分钟播客在22.95分钟内完成,4.08倍实时速度,比Python基线快2.86倍(无量化)。原生C++/ggml

Reddit r/LocalLLaMA ↗ · 2026-07-01

VibeVoice 1.5B,一个长篇幅多说话人TTS模型,现已获得audio.cpp(原生C++/ggml运行时)的支持,在RTX 5090上实现4.08倍实时速度,比无量化的Python基线快2.86倍。

0 人收藏 0 人点赞
#ggml

Qwen3-tts.cpp + Compose 桌面 GUI

Reddit r/LocalLLaMA ↗ · 2026-06-29

开发者改进了 qwen3-tts.cpp,使其在 RTX 5080 上实现 5 倍实时运行,并使用 Kotlin Compose Multiplatform 创建了跨平台桌面 GUI,具备语音克隆、流式传输和说话人嵌入管理功能。

0 人收藏 0 人点赞
#ggml

又一次大型张量修复 b9820

Reddit r/LocalLLaMA ↗ · 2026-06-27

通过在 ggml 后端中减少分割计算期间的同步来提升性能,新增异步 CUDA 复制功能,并让同步放宽机制在多个后端中更通用。

0 人收藏 0 人点赞
#ggml

audio.cpp: 集成12种音频模型(Qwen3-TTS、PocketTTS、VeVo2等)于一个C++/ggml运行时 — 在CUDA上TTS速度比Python快5倍

Reddit r/LocalLLaMA ↗ · 2026-06-25

audio.cpp是一个C++/ggml运行时,集成了包括Qwen3-TTS、PocketTTS和VeVo2在内的12种音频模型,在CUDA上实现TTS速度比Python快5倍。

0 人收藏 0 人点赞
#ggml

llama.cpp 中的流水线并行可能浪费你的显存

Reddit r/LocalLLaMA ↗ · 2026-06-08

测试表明,llama.cpp 默认的流水线并行浪费显存且无速度提升;通过编译时设置 GGML_SCHED_MAX_COPIES=1 可节省大量显存,同时保持相同推理速度。

0 人收藏 0 人点赞
#ggml

@badlogicgames: 一个很棒的项目:parakeet.cpp https://github.com/mudler/parakeet.cpp… 基于GGML的parakeet推理管道…

X AI KOLs Following ↗ · 2026-05-31 缓存

parakeet.cpp 是一个快速、轻依赖的C++17推理管道,用于NVIDIA的NeMo Parakeet语音识别模型,基于ggml构建。它能实现与NeMo字节相同的转录结果,并在CPU和GPU上显著提升速度。

0 人收藏 0 人点赞
#ggml

我将 NVIDIA Parakeet(语音转文本)移植到 ggml:与 NeMo 输出相同,速度更快,GGUF 量化,无需 Python

Reddit r/LocalLLaMA ↗ · 2026-05-31

NVIDIA 的 Parakeet 语音转文本模型已被移植到纯 C++/ggml,实现了与 NeMo 字节完全相同的输出,GPU 上推理速度提升高达 5 倍,并提供量化的 GGUF 变体,无需 Python 或 PyTorch 即可在任何地方高效部署。

0 人收藏 0 人点赞
#ggml

@ggerganov:突出展示 llama.cpp/ggml 中的新 WebGPU 后端 为在 llama.cpp 中实现完整 WebGPU 支持的工作始于…

X AI KOLs Following ↗ · 2026-05-22 缓存

本文重点介绍了 llama.cpp/ggml 中的全新 WebGPU 后端,它能够在浏览器中实现 GPU 加速的本地 AI 模型推理,由 Reese Levine 及其在 USCS 的团队在过去一年半中开发完成。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈