llamacpp

标签

Cards List
#llamacpp

我终于从Windows切换到Linux,并获得了30-50%的速度提升。

Reddit r/LocalLLaMA ↗ · 2026-08-23

用户从Windows切换到Linux,并将llamacpp替换为vllm,在AI推理中实现了30-50%的速度提升。

0 人收藏 0 人点赞
#llamacpp

Minimax-M3 的视觉支持已合并到 llama.cpp

Reddit r/LocalLLaMA ↗ · 2026-07-26 缓存

Minimax-M3 模型的视觉支持已合并到 llama.cpp 项目,使得该模型可以在本地进行多模态推理。

0 人收藏 0 人点赞
#llamacpp

Laguna-S-2.1 运行在我6年前的旧游戏电脑上!

Reddit r/LocalLLaMA ↗ · 2026-07-22

Laguna-S-2.1 是一个量化AI模型,运行在配备RTX 3080的6年前旧游戏电脑上,解码速度达到10 token/秒,占用8.3 GB显存和52.2 GB主机内存。

0 人收藏 0 人点赞
#llamacpp

llamacpp有一个新的PR,声称使用rocm可将提示处理速度提升约15%,同时修复了一个bug,使Q2_K的速度提升了28倍

Reddit r/LocalLLaMA ↗ · 2026-07-21 缓存

llama.cpp的一个新PR将ROCm上的提示处理速度提升了约15%,并修复了一个bug,使Q2_K量化速度提升了28倍。

0 人收藏 0 人点赞
#llamacpp

我测试了 llama.cpp 在 Qwen 3.6 27B 上的所有推测性解码方法:MTP ~2.7x, DFlash ~3.7x, n-gram 堆叠在真实编码中达到 ~6x。本地 AI 获胜。我在 RTX 6000 PRO 上的发现。

Reddit r/LocalLLaMA ↗ · 2026-07-16

llama.cpp 在 Qwen 3.6 27B 上的推测性解码方法的全面基准测试表明,在 DFlash 上叠加 n-gram 堆叠在迭代编码任务中实现了高达 6 倍的加速,其中 ngram-mod 贡献了大部分增益且零 VRAM 成本。

0 人收藏 0 人点赞
#llamacpp

@ivanfioravanti: DGX Spark 上下文基准测试基于 Qwen3.6-35B-A3B-UD-Q8_K_XL,使用 Mia 发布的 llamacpp 脚本。速度很快!是时候测试质…

X AI KOLs Timeline ↗ · 2026-07-06 缓存

基于 Qwen3.6-35B-A3B-UD-Q8_K_XL 在 DGX Spark 上的基准测试结果,使用 Mia 发布的 llama.cpp 脚本,展示了在不同上下文长度下快速的 token 生成时间。

0 人收藏 0 人点赞
#llamacpp

我正在改用Linux,Ubuntu是否对本地AI兼容性最好?

Reddit r/LocalLLaMA ↗ · 2026-07-02

一位用户询问在改用Linux时,Ubuntu与vLLM、llama.cpp和ComfyUI等本地AI工具的兼容性。

0 人收藏 0 人点赞
#llamacpp

Qwen3.6 27B 在 vLLM 中的表现比在 llama.cpp 中更差

Reddit r/LocalLLaMA ↗ · 2026-06-24

一名用户报告称,Qwen3.6-27B 模型在使用 llama.cpp 时比使用 vLLM 表现更好且更可靠,并指出尽管进行了大量配置,vLLM 仍出现工具调用错误和“被切除脑叶”的行为。

0 人收藏 0 人点赞
#llamacpp

48GB VRAM + Qwen 3.6 27B 的最佳设置

Reddit r/LocalLLaMA ↗ · 2026-06-20

一位用户分享了在双GPU配置(RTX 4090 + RTX 3090)上使用llama.cpp运行Qwen3.6 27B (Q8_0)的优化设置,在250k上下文下实现了75-100 t/s和1500 pp。

0 人收藏 0 人点赞
#llamacpp

我不知道居然可以同时编译llamacpp来运行CUDA和Vulkan..

Reddit r/LocalLLaMA ↗ · 2026-06-16

作者发现同时使用CUDA和Vulkan后端编译llama.cpp是可行的,解码速度提升了约10% tokens/秒。他们计划运行进一步基准测试来评估其优势。

0 人收藏 0 人点赞
#llamacpp

bartowski/command-a-plus-05-2026-GGUF · Hugging Face

Reddit r/LocalLLaMA ↗ · 2026-06-16 缓存

Cohere 的 command-a-plus-05-2026 模型的 GGUF 量化版本,针对 llama.cpp 进行了优化,并提供了多种量化级别,适用于本地推理。

0 人收藏 0 人点赞
#llamacpp

Gemma 12b 低于10瓦 6.5pp 1.3tg

Reddit r/LocalLLaMA ↗ · 2026-06-14

在Google Pixel 10 Pro上使用llama.cpp运行Gemma 12B模型,实现了每秒6.5个token的提示处理和每秒1.3个token的生成,功耗低于10瓦,展示了高效的设备端AI推理。

0 人收藏 0 人点赞
#llamacpp

有没有人成功让 Gemma 4 12B(统一音频)在带有大型系统提示时真正关注语音?

Reddit r/LocalLLaMA ↗ · 2026-06-10

用户报告称,当系统提示较大(约 21k 个 token)时,Gemma 4 12B 统一音频模型会停止关注语音,并请求变通方法或解释,指出该问题在 vLLM、llama.cpp 和 LiteRT-LM 后端中均存在。

0 人收藏 0 人点赞
#llamacpp

FYI: llamacpp 服务器现在可以在30秒内热切换模型

Reddit r/LocalLLaMA ↗ · 2026-06-05

Llamacpp 服务器现在支持在30秒内热切换模型,相比之前像 PyTorch 等方法,速度显著提升。

0 人收藏 0 人点赞
#llamacpp

@no_stp_on_snek:首次在我的 llamacpp 分支上测试了 MTP,使用 turbo4 sym。GX10 硬件。使用 MoE 模型:llmfa…

X AI KOLs Following ↗ · 2026-05-22 缓存

在 llamacpp 分支上使用基于 Qwen 的 MoE 模型测试了多 token 预测,相比 fp16 基线获得了 +0.41% 的 PPL 提升。

0 人收藏 0 人点赞
#llamacpp

新的BITNET模型!

Reddit r/LocalLLaMA ↗ · 2026-05-18

OpenBMB发布的新BitCPM4-CANN模型(1B、3B、8B),已上架Hugging Face;等待llamacpp支持以进行测试。

0 人收藏 0 人点赞
#llamacpp

RTX Pro 4500 Blackwell - Qwen 3.6 27B?

Reddit r/LocalLLaMA ↗ · 2026-05-09

一位开发者分享了在搭载 NVIDIA RTX Pro 4500 Blackwell 显卡的服务器上,使用 llama.cpp 运行 Qwen3.6-27B 模型的本地推理基准测试数据及 systemd 配置。该帖文征集了提升吞吐量的优化建议,并探讨了更大模型的潜在应用场景。

0 人收藏 0 人点赞
#llamacpp

@ivanfioravanti: llamacpp 即将支持 MTP!

X AI KOLs Following ↗ · 2026-05-08 缓存

llamacpp 即将支持多令牌预测(MTP),提升推理效率。

0 人收藏 0 人点赞
#llamacpp

Qwen-3.6-27B + llamacpp 投机解码效果惊艳

Reddit r/LocalLLaMA ↗ · 2026-04-23

Reddit 用户展示了 llamacpp 的投机解码功能将 Qwen-3.6-27B 的生成速度从 13.6 提升至 136.75 t/s,并分享了完整的命令参数和硬件配置。

0 人收藏 0 人点赞
#llamacpp

Qwen3.6-27B Uncensored Aggressive 发布,附带 K_P 量化!

Reddit r/LocalLLaMA ↗ · 2026-04-22

社区释出去除安全拒答的 Qwen3.6-27B,并以专为 llama.cpp 与 LM Studio 优化的 K_P GGUF 量化格式打包。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈