llama-cpp

标签

Cards List
#llama-cpp

llama.cpp 中 DFlash2 的支持已合并!- 规范:添加 DFlash2 支持(局部卷积 + 候选选择器)由 SubSir · 拉取请求 #27342 · ggml-org/llama.cpp

Reddit r/LocalLLaMA · 2026-08-27 缓存

DFlash2 的支持已通过拉取请求 #27342 合并到 llama.cpp 中,为 LLM 推理工具添加了局部卷积和候选选择器功能。

0 人收藏 0 人点赞
#llama-cpp

我使用本地 Qwen 27b 构建了一个工具框架来替代 OpenCode

Reddit r/LocalLLaMA · 2026-08-27

作者构建了一个开源的本地大语言模型运行框架,以 Qwen 27b 为基础,支持即时代码审查、子代理、语音听写等功能,并分享了开发心得。

0 人收藏 0 人点赞
#llama-cpp

Qwen3.8-Flash-Next: 是时候更新那些基准测试了

Reddit r/LocalLLaMA · 2026-08-27

本文对Qwen3.8-Flash-Next模型进行了基准测试,显示其在个人基准测试中突破了94%,并比较了其在编程、通用知识和科学方面与其他模型的性能。

0 人收藏 0 人点赞
#llama-cpp

在Claude Code中使用本地LLM作为代理

Reddit r/LocalLLaMA · 2026-08-27

本文介绍了一种自定义的MCP设置,允许在同一会话中使用如llama.cpp等工具,将编码任务从Anthropic的Claude模型卸载到本地的Qwen3.8-27B模型。

0 人收藏 0 人点赞
#llama-cpp

orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF

Hugging Face Models Trending · 2026-08-26 缓存

本文发布未经审查的 Qwen3.8-Flash-Next 模型的 GGUF 量化版本,这是 Qwen4 架构的混合专家模型预览版,专为支持视觉功能的 llama.cpp 设计,需要自定义构建以确保兼容性。

0 人收藏 0 人点赞
#llama-cpp

在16GB显存的RTX 4080上运行Qwen3.8-27B的提速指南

Reddit r/LocalLLaMA · 2026-08-26

本指南说明如何配置llama.cpp的DFlash2推测解码,以在配备16GB显存的RTX 4080 GPU上实现Qwen3.8-27B模型最高1.72倍的推理速度提升。

0 人收藏 0 人点赞
#llama-cpp

AI在家第二部分:多GPU技术

Lobsters Hottest · 2026-08-25 缓存

本文探讨了在使用电子废弃GPU搭建的家庭服务器上优化AI语言模型性能,并解释了Transformer模型和多GPU技术。

0 人收藏 0 人点赞
#llama-cpp

关于Hugging Face收购事项的讨论..

Reddit r/LocalLLaMA · 2026-08-25

本文讨论了关于Hugging Face收购llama.cpp/ggml的担忧,探索了对人工智能生态系统的潜在风险,以及许可证保护和社区意见的问题。

0 人收藏 0 人点赞
#llama-cpp

已修复 7900 xtx + 无头 Linux 崩溃(低内存 OOM)amdgpu.runpm=0

Reddit r/LocalLLaMA · 2026-08-25

用户通过禁用运行时电源管理,解决了在无头 Linux 系统上使用 AMD GPU 运行大型 AI 模型时崩溃的问题,防止模型权重被转储到有限内存中导致 OOM 错误。

0 人收藏 0 人点赞
#llama-cpp

llama.cpp 文档现已拥有新家 ❤️

Reddit r/LocalLLaMA · 2026-08-24 缓存

llama.cpp 项目在 llama.app 推出了新的官方文档网站,提供使用 llama cli 和 llama server 进行本地 LLM 推理的全面指南。

0 人收藏 0 人点赞
#llama-cpp

你现在可以在GLM-Air中使用MTP

Reddit r/LocalLLaMA · 2026-08-23 缓存

llama.cpp现在支持GLM-Air模型的MTP(多令牌预测),增强了C/C++中大型语言模型的推理能力。

0 人收藏 0 人点赞
#llama-cpp

### 基准测试结果:在macOS上运行Qwen3.8-27B的最佳且最快的引擎是什么? 目前尚未有官方或广泛认可的基准测试明确指出运行 **Qwen3.8-27B**(假设为27B参数模型)在macOS上性能最优的引擎。实际性能高度依赖于以下因素: 1. **硬件配置**:特别是Mac芯片型号(M1/M2/M3/M4 Pro/Max/Ultra)、统一内存容量和速度。 2. **模型量化格式**:使用的GGUF/GGML量化级别(如Q4_K_M, Q8_0等)显著影响速度和内存占用。 3. **引擎版本与优化**:引擎的编译优化、对Apple Silicon的Metal/Vulkan后端支持程度。 **不过,基于社区普遍反馈和当前技术栈,以下引擎通常被认为在macOS上运行大型语言模型表现出色:** #### 1. **llama.cpp(及其衍生版本)** - **优势**:高度优化,原生支持Apple Silicon的**Metal**加速,性能卓越。是macOS上运行量化模型(GGUF格式)的**事实标准**。 - **推荐**:使用最新版本的 `llama.cpp`,并在编译时启用Metal后端。其子项目 `llama-ggml-metal` 性能强劲。 - **运行方式**:通常通过命令行工具(如 `llama-cli`, `llama-server`)运行。 #### 2. **MLX** - **优势**:由Apple团队开发的**专为Apple Silicon优化的机器学习框架**。能原生利用芯片的统一内存和GPU,理论上能实现最佳性能和内存效率。 - **现状**:对部分模型有良好支持,但生态和模型兼容性(尤其是GGUF格式)相比llama.cpp可能稍逊。需确认Qwen3.8-27B是否有适配MLX的版本。 - **推荐**:如果MLX版本可用且性能良好,它很可能是**“最快”** 的选择。 #### 3. **LM Studio** - **优势**:提供开箱即用的图形界面,底层集成了`llama.cpp`等引擎,并进行了优化配置。对用户友好,性能也十分优秀。 - **推荐**:适合希望便捷管理模型和参数,并快速获得良好性能的用户。 **如何自行寻找“最佳”答案?** 由于缺乏统一基准,最可靠的方法是**自己测试**: 1. **下载引擎**:获取最新版本的 `llama.cpp`(带Metal)、 `MLX` 相关推理工具,或 `LM Studio`。 2. **准备模型**:下载适用于你目标引擎的 `Qwen3.8-27B` 量化文件(例如GGUF格式)。 3. **进行基准测试**: - **速度**:测量生成速度(tokens/秒)。 - **内存**:观察内存占用峰值。 - **稳定性**:确保运行稳定。 4. **调整参数**:在每种引擎中调整上下文长度(`-c`)等参数,找到平衡点。 **结论建议:** - **追求极致性能与兼容性**:首选 **llama.cpp**(确保启用Metal)。 - **追求Apple生态原生与潜在最优效率**:尝试 **MLX**,但需先确认模型支持。 - **追求便捷性与高性能的平衡**:选择 **LM Studio**。 请记住,27B参数的模型即使量化后,也需要 **32GB 或更多统一内存** 的Mac才能流畅运行。请根据你的具体硬件进行选择和测试。

Reddit r/LocalLLaMA · 2026-08-23

本文对macOS上运行通义千问Qwen 3.8 27B模型的各类引擎进行了基准测试,比较了其在智能体编程任务中的速度与性能表现,并推荐使用MTPLX或搭载MTP技术的llama.cpp以获得最佳效果。

0 人收藏 0 人点赞
#llama-cpp

AMD 用户:您试过 llama.cpp 的 AMD-Ecosystem 分支吗?最高 2 倍提示处理速度

Reddit r/LocalLLaMA · 2026-08-23

本文讨论了 llama.cpp 的一个 AMD 特定分支,该分支显著提升了 AMD 用户的提示处理速度,使用 ROCm/Hip 时,在密集模型上性能最高提升 2 倍,尽管在其他指标上有些权衡。

0 人收藏 0 人点赞
#llama-cpp

在128GB内存与约60GB显存(PCIe配置较弱)环境下运行DeepSeek-V4-Flash-0731 q4+量化版本的三次实验:实现可接受的生成速度和提示处理速度

Reddit r/LocalLLaMA · 2026-08-22

作者在配备128GB内存的系统上实验运行DeepSeek-V4-Flash-0731的4位量化模型,通过内存锁定和提示处理策略等优化手段,达到了可接受的推理速度。

0 人收藏 0 人点赞
#llama-cpp

GLM 和我创建了一个针对 AMD GFX906(Mi50、Mi60、Radeon VII、GCN HIP)优化的 llama.cpp 分支 - 机器学习、大语言模型和 AI

Reddit r/LocalLLaMA · 2026-08-22

已创建一个 llama.cpp 的分支,并针对 AMD GFX906 GPU 进行了优化,提升了 Mi50、Mi60、Radeon VII 和 GCN HIP 上的性能,适用于机器学习和大语言模型应用。

0 人收藏 0 人点赞
#llama-cpp

我fork了Ninfer 3090并将其转换为在CMP170HX上运行 - 使llama.cpp的Qwen3.6-35B性能翻倍

Reddit r/LocalLLaMA · 2026-08-22

一位用户fork了Ninfer推理引擎以在CMP170HX GPU上运行,使llama.cpp的Qwen3.6-35B模型性能翻倍,并分享了配置细节。

0 人收藏 0 人点赞
#llama-cpp

@wherecall1: 3060 12G 跑 Qwen3.8-27B-Unleashed(无审查)安装踩坑记录,每个坑都标了解法,照着做即可复现。 ① 选版本 仓库:outsourc-e/Qwen3.8-27B-Unleashed-GGUF,9 个量化档。306…

X AI KOLs Timeline · 2026-08-22 缓存

本文提供了在3060 12G显卡上运行Qwen3.8-27B-Unleashed模型的详细安装指南,涵盖版本选择、下载问题和启动配置,并总结了常见错误的解决方法。

0 人收藏 0 人点赞
#llama-cpp

Llama.cpp 0.2.0 版本发布!

Reddit r/LocalLLaMA · 2026-08-22

Llama.cpp 是一个流行的开源工具,用于运行 LLaMA 模型,现已发布 0.2.0 版本,包含更新日志和预构建二进制文件,可在 GitHub 上获取。

0 人收藏 0 人点赞
#llama-cpp

Llama.cpp DSpark PC Tree 分支(速度提升高达3%-29.5%!)

Reddit r/LocalLLaMA · 2026-08-21

在一个 llama.cpp 分支中实现了 DSpark PC Tree,根据基准测试结果,在 Qwen 3.0 模型上显示了推理速度最高提升29.5%的性能优势。

0 人收藏 0 人点赞
#llama-cpp

[基准测试] DFlash2 与 MTP 比较。5090RTX, Qwen 3.8 27B, Dynamic v3 GGUF, llama.cpp。令牌生成、延迟和可用上下文。

Reddit r/LocalLLaMA · 2026-08-21

该基准测试对 llama.cpp 中的 DFlash2 与 MTP 技术进行了比较,结果表明 DFlash2 的令牌生成速度提高了约 20%,但可用上下文减少了 38%。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈