llama-cpp

标签

Cards List
#llama-cpp

两块RTX 4090实际能同时运行多少个代理?三周的llama.cpp并发数据——软上限5 @ 64k,硬上限9,以及原因。

Reddit r/LocalLLaMA · 21小时前

关于在两块RTX 4090 GPU上使用llama.cpp并发运行多个AI代理的基准测试报告,揭示了性能限制和Qwen模型的最佳配置。

0 人收藏 0 人点赞
#llama-cpp

针对Strix Halo - 官方llama.cpp并非理想选择及如何实现最高吞吐量

Reddit r/LocalLLaMA · 昨天

本文讨论了在Strix Halo硬件上优化性能的官方llama.cpp替代方案,其中特定分支在AI推理任务中实现了显著更高的吞吐量。

0 人收藏 0 人点赞
#llama-cpp

ExLlamaV3 被低估了

Reddit r/LocalLLaMA · 昨天

作者推荐ExLlamaV3,这是一个被低估的本地AI推理工具,在NVIDIA硬件上性能优于llama.cpp,最近的更新如CPU MoE卸载提升了其性能。

0 人收藏 0 人点赞
#llama-cpp

一种稀疏 MoE 模型推理架构:通过分层与线性衰减增加激活参数量,无需训练或微调即可实现精简推理 [p]

Reddit r/MachineLearning · 3天前

一种 llama.cpp 实现,可在推理阶段通过自适应阈值与分层线性衰减将 MoE 专家路由扩展至原生 top-K 之外,无需重新训练或微调。

0 人收藏 0 人点赞
#llama-cpp

基于 llama.cpp 的专家扩展

Reddit r/LocalLLaMA · 3天前

一位开发者构建了 llama.cpp 的自定义分支,为混合专家(MoE)模型实现了专家扩展功能,已在 Metal 上完成测试,现寻求跨平台反馈。

0 人收藏 0 人点赞
#llama-cpp

模型:由 Little0o0 添加 Tencent Hy 4 (hy_v4) 预览架构支持 · 拉取请求 #28127 · ggml-org/llama.cpp

Reddit r/LocalLLaMA · 5天前 缓存

一个 GitHub 拉取请求为 llama.cpp C/C++ 推理库添加了 Tencent Hy 4 (hy_v4) 预览架构支持,使此新模型能够进行本地推理。

0 人收藏 0 人点赞
#llama-cpp

@UnslothAI: 我们让 GLM-5.3-Flash 在本地运行速度提升3.3倍!本地 GGUF 推理现在快1.6–3.4倍,通过优化解码和…

X AI KOLs Following · 5天前 缓存

Unsloth AI 宣布对 GLM-5.3-Flash 进行优化,实现1.6–3.4倍更快的本地 GGUF 推理,支持多令牌预测和运行本地模型的硬件要求。

0 人收藏 0 人点赞
#llama-cpp

Qwen3.8-Flash-Next MTP 集成至 ik_llama.cpp(集成头或单独 -md 文件)... 在 5090 + 128GB 上 45 → 90 tok/s,甚至可在 12GB 4070 上运行

Reddit r/LocalLLaMA · 6天前

文章详细描述了将 Multi-Token Prediction (MTP) 支持合并至 ik_llama.cpp 的过程,这显著提升了 Qwen3.8-Flash-Next 模型的令牌生成速度,基准测试显示在高端硬件上速度最高可提升一倍。

0 人收藏 0 人点赞
#llama-cpp

本地AI无法禁用

Reddit r/LocalLLaMA · 6天前

云端AI服务如ChatGPT、Claude和Grok宕机,凸显了本地AI工具如llama.cpp的可靠性。

0 人收藏 0 人点赞
#llama-cpp

IFM/K2-Horizon-MoVA-36B-A4B-GGUF · Hugging Face

Reddit r/LocalLLaMA · 6天前 缓存

这是K2-Horizon-MoVA-36B-A4B模型的GGUF版本,一个具有36B总参数和每令牌4B活动参数的混合专家AI模型,针对llama.cpp使用进行了优化。它在代理和推理基准测试中展示了前沿级别的性能,与更大和封闭的模型竞争。

0 人收藏 0 人点赞
#llama-cpp

Qwen3.6 35b Q2_XXS:在2026年,GPU 贫困也没那么糟糕

Reddit r/LocalLLaMA · 6天前

展示了在2026年,即使在显卡性能不足的情况下,也能通过量化版Qwen3.6-35B模型在低端笔记本电脑上用24分钟构建类塞尔达RPG游戏。

0 人收藏 0 人点赞
#llama-cpp

Qwen3.8-Flash-Next 在双 RTX 3090 + DDR4 上:解码速度从 17 提升至 25-29 令牌/秒,使用专家缓存 PR

Reddit r/LocalLLaMA · 6天前

用户基准测试并详述了 llama.cpp 中的 GPU 常驻专家缓存 PR,该 PR 将 Qwen3.8-Flash-Next 在双 RTX 3090 系统上的解码速度从 17 提升至 25-29 令牌/秒。

0 人收藏 0 人点赞
#llama-cpp

@AdinaYakup: 很高兴看到实验室发布他们自己的 GGUFs 🔥 https://huggingface.co/AngelSlim/Hy4-preview-GGUF…

X AI KOLs Timeline · 6天前 缓存

这条推文分享了腾讯 Hy4-preview 模型的 GGUF 构建版本,包括量化版本以及使用经过修补的 llama.cpp 运行它们的说明。

0 人收藏 0 人点赞
#llama-cpp

Mac发烧友:2026年9月MLX还有存在价值吗?

Reddit r/LocalLLaMA · 2026-09-02

一名用户质疑MLX在Apple M5芯片上的相关性,因为llama.cpp的Metal更新提升了GGUF模型的预填充性能,使得MLX在某些任务上可能变得冗余。

0 人收藏 0 人点赞
#llama-cpp

DeepSeek-V4-Flash-Vision-Exp 模型现已支持视觉功能

Reddit r/LocalLLaMA · 2026-09-02 缓存

DeepSeek-V4-Flash-Vision-Exp 模型的视觉支持功能已成功整合到 llama.cpp 框架中,这显著提升了其在多模态人工智能推理方面的能力。

0 人收藏 0 人点赞
#llama-cpp

@superalesha: 你们大多数人可能不知道一个8.4GB的模型在12GB RTX 3080 Ti上能做什么。Qwen3.8-27B制作了这个体素日本宝塔花园……

X AI KOLs Timeline · 2026-09-02 缓存

展示了Qwen3.8-27B AI模型在12GB RTX 3080 Ti GPU上的性能,使用llama.cpp在特定量化设置下,在128K上下文中达到每秒47个令牌。

0 人收藏 0 人点赞
#llama-cpp

问题:为什么 vLLM 的预填充速度远超其他推理引擎?

Reddit r/LocalLLaMA · 2026-09-01

用户分享了基准测试结果,显示 vLLM 的预填充性能显著快于 llama.cpp 和其他引擎,并质疑这种速度差异背后的技术原因。

0 人收藏 0 人点赞
#llama-cpp

Vellium v1.1.0 — 实时语音、本地 STT/TTS 与更简便的 llama.cpp 设置

Reddit r/LocalLLaMA · 2026-09-01

Vellium v1.1.0 引入实时语音聊天功能,支持使用 Whisper 和 TeraTTSv2 进行本地 STT/TTS,并简化了 llama.cpp 设置,以便更轻松地与本地 AI 模型集成。

0 人收藏 0 人点赞
#llama-cpp

Qwen 3.8 27b (Q4KM) 一次生成超级马里奥克隆游戏

Reddit r/LocalLLaMA · 2026-09-01

一位用户展示了使用LLAMA.cpp,Qwen 3.8 27b AI模型能在单次提示下生成一个完全独立的超级马里奥克隆游戏,在Windows PC和Macbook M5 Air上用时117分钟完成该任务。

0 人收藏 0 人点赞
#llama-cpp

MTP 已发布 Qwen3.8-Flash-Next-GGUF

Reddit r/LocalLLaMA · 2026-09-01 缓存

Qwen3.8-Flash-Next-GGUF 模型的 MTP 已发布,并提供了与 llama.cpp、vLLM 和 Ollama 等推理工具集成的详细部署说明。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈