llama-cpp

标签

Cards List
#llama-cpp

Qwen 35B-A3B MoE 与 27B dense 本地编码测试对比:速度快约 4 倍,质量差距远小于预期

Reddit r/LocalLLaMA · 昨天

一项本地实验,在代码维护任务上比较 Qwen 35B-A3B MoE 和 Qwen 27B dense,发现 MoE 模型速度快约 3.9 倍,且质量差距比预期更小。

0 人收藏 0 人点赞
#llama-cpp

Qwen 3.6 27B 在 llama.cpp 中的标志/设置

Reddit r/LocalLLaMA · 昨天

一位用户分享了他们在 RTX 5090 上运行 Qwen 3.6 27B 的 llama.cpp 服务器配置,达到了 80-100 t/s 的速度,并向社区询问其他设置和技巧。

0 人收藏 0 人点赞
#llama-cpp

llama.cpp PR 报告:仅切换一个 SYCL 内核,Intel Battlemage 上量化 KV 解码在 118K 上下文最高提速 169%

Reddit r/LocalLLaMA · 昨天

llama.cpp 的一个 PR 提议将 Intel Battlemage 上的量化 KV 解码从 VEC 切换到 TILE SYCL 内核,据报道在 118K 上下文下解码速度提升最高约 169%。该 PR 目前处于开放状态,存在一些注意事项,且独立验证有限。

0 人收藏 0 人点赞
#llama-cpp

一个 llama.cpp PR 让 Q2_0 在 x86 CPU 上提速 3.0–3.6 倍,8B 解码从 2.39 升至 8.20 tok/s

Reddit r/LocalLLaMA · 2天前

一个 llama.cpp 拉取请求为 Q2_0 × Q8_0 点积添加了 x86 VNNI 实现,在 Bonsai 模型上实现了 3.0–3.6 倍的纯 CPU 加速,内核级逐位精确,且 token 一致性达 99.2%。

0 人收藏 0 人点赞
#llama-cpp

双3090配置:Qwen 3.6 27B 上从 400 pp tokens/s 提升到 1600 pp tokens/s... 但 tps 略降。

Reddit r/LocalLLaMA · 2天前

使用双 RTX 3090 配置的用户发现,llama.cpp 的 `--split-mode tensor` 会在 CPU 上运行提示处理(约 400 t/s),而切换到 `--split-mode layer` 则可解锁 GPU 提示处理,速度超过 1600 t/s,且 token 生成速度仅略有下降。

0 人收藏 0 人点赞
#llama-cpp

Auto-fit vs tuned MoE offload: 564 → 1330 pp tok/s, unchanged decode (Qwen3.6-35B-A3B Q6 / RTX 3090)

Reddit r/LocalLLaMA · 3天前

A developer benchmarks Qwen3.6-35B-A3B Q6 on an RTX 3090, showing that offloading eight MoE expert layers to CPU and increasing batch sizes improves prompt processing by 2.36× (564→1330 tok/s) with no decode speed regression, using evolutionary search to find the tuning config.

0 人收藏 0 人点赞
#llama-cpp

最终优化:在1块RTX 3090上,DeepSeek-V4-Flash-0731在128K上下文下从约10 tok/s提升至约15 tok/s

Reddit r/LocalLLaMA · 3天前

详细测试和调优,以在RTX 3090上优化GGUF格式的DeepSeek-V4-Flash-0731,通过不同的量化和加载参数,在128K上下文下达到约15 tok/s。

0 人收藏 0 人点赞
#llama-cpp

Qwen3-TTS 语音克隆现已进入 llama.cpp 主线——旧演示终于成为真正的支持

Reddit r/LocalLLaMA · 4天前

Qwen3-TTS 语音克隆已合并到 llama.cpp 主线,通过 llama-tts 二进制文件,利用短参考音频即可在本地实现文本转语音和语音克隆,支持多种语言。目前仍有限制,包括仅支持 Base 模型,且尚无服务器端点。

0 人收藏 0 人点赞
#llama-cpp

2.6B 参数模型支持工具调用和 128K 上下文,现可在手机上以 30 tok/s 运行

Reddit r/LocalLLaMA · 4天前

Liquid AI 发布了 LFM2.5-2.6B,这是一个 2.69B 参数模型,支持 128K 上下文和工具调用,专为多步骤智能体工作流优化,可在手机上以 30 tok/s 运行,Q4_K_M GGUF 文件约 1.67GB。不过,与更大的模型相比,其在编码和知识密集型任务上仍然较弱。

0 人收藏 0 人点赞
#llama-cpp

Llama.cpp PR 带来 8% 速度提升

Reddit r/LocalLLaMA · 5天前

一个 llama.cpp PR 将采样从 CPU 移至 GPU,在 RTX 5090 上为 Qwen3.6-35B 推理带来 8% 的 token 速度提升,在 Tesla P40 上约为 4%。

0 人收藏 0 人点赞
#llama-cpp

@no_stp_on_snek:延迟了,但终于来了。DeepSeek-V4-Flash-0731 的 GGUF 格式,每权重 2.88 比特,95 GiB,可在单台 128 GB 机器上运行……

X AI KOLs Following · 6天前 缓存

DeepSeek-V4-Flash-0731 以 GGUF 格式发布,每权重 2.88 比特(95 GiB),使 284B 参数的 MoE 模型可在 128 GB 机器上运行。附带详细的操作指南,以及所需的 TurboQuant llama.cpp 分支。

0 人收藏 0 人点赞
#llama-cpp

DeepSeek V4 @ IQ3XXS 在 M1 Ultra 128GB 上的 LM Studio 中经补丁后可达 16 tok/s

Reddit r/LocalLLaMA · 6天前 缓存

一个 GitHub 补丁通过侧载 antirez 的 llama.cpp 分支,解决了结构布局漂移、解码拆分和代码签名问题,从而允许在 128GB Mac 上的 LM Studio 中运行 DeepSeek V4 Flash。

0 人收藏 0 人点赞
#llama-cpp

llama.cpp 刚刚为 DeepSeek V4 Flash 添加了 MTP / DSpark 支持

Reddit r/LocalLLaMA · 2026-08-02 缓存

llama.cpp 已为 DeepSeek V4 Flash 添加 MTP/DSpark 支持,从而通过流行的 C/C++ LLM 运行时实现本地推理。

0 人收藏 0 人点赞
#llama-cpp

DeepSeek-V4-Flash-0731 用户的 PSA——不要在对话中途用系统角色消息破坏提示缓存

Reddit r/LocalLLaMA · 2026-08-02

这则 PSA 提醒 DeepSeek-V4-Flash-0731 用户:系统角色消息会被提升到最顶部,破坏提示缓存和邻近性,并建议改用 latest_reminder。

0 人收藏 0 人点赞
#llama-cpp

LiquidAI/LFM2.5-2.6B-GGUF

Hugging Face Models Trending · 2026-08-01 缓存

此 Hugging Face 模型卡片介绍了 LiquidAI 的 LFM2.5-2.6B 模型(GGUF 量化格式),并提供了通过 llama.cpp、vLLM、Ollama 等工具在本地运行的说明。

0 人收藏 0 人点赞
#llama-cpp

IQ3 DS 发布

Reddit r/LocalLLaMA · 2026-07-31 缓存

Unsloth 发布了 DeepSeek-V4-Flash-0731 的 IQ3 GGUF 量化版本,支持通过 llama.cpp、Ollama、LM Studio 等工具进行本地推理。

0 人收藏 0 人点赞
#llama-cpp

我以为在标准智能手机上运行大规模模型已经非常了不起了,但

Reddit r/AI_Agents · 2026-07-30

bigedgeonmoe开源代码库的创建者使得在移动设备和消费级PC上运行大规模MoE模型(高达120B参数)成为可能,在中端手机上实现了Qwen 35B模型每秒6个token的速度。

0 人收藏 0 人点赞
#llama-cpp

基准测试:用于 llama.cpp 的 MindControl

Reddit r/LocalLLaMA · 2026-07-30

针对 MindControl(一种用于 llama.cpp 的采样器级引导推理预算)的基准测试结果显示出,多阶段信号传递可以在不损失准确率的情况下减少 token 消耗,并且在较简单任务上有时还能提升准确率。

0 人收藏 0 人点赞
#llama-cpp

4090 + 5060 Ti + 64GB RAM:35B-A3B 达 206 t/s,122B 达 37 t/s

Reddit r/LocalLLaMA · 2026-07-30

一位用户分享了在双 GPU(RTX 4090 和 RTX 5060 Ti)上运行大语言模型(Qwen 27B-122B)的基准测试结果,实现了极高的 token 生成速度(例如 35B-A3B 达到 206 t/s,122B 达到 37-41 t/s)。帖子包含配置详情以及指向 GitHub 仓库的链接,其中包含脚本和原始数据。

0 人收藏 0 人点赞
#llama-cpp

@gp_pulipaka: Ollama vs. LM Studio vs. llama.cpp:2026年你应该使用哪个本地AI运行时?#BigData #Analytics #DataScience #AI…

X AI KOLs Timeline · 2026-07-30 缓存

详细对比了三种本地AI运行时——Ollama、LM Studio和llama.cpp,从界面、API兼容性、量化控制等方面帮助从业者根据自己的工作流程选择合适的工具。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈