标签
一项本地实验,在代码维护任务上比较 Qwen 35B-A3B MoE 和 Qwen 27B dense,发现 MoE 模型速度快约 3.9 倍,且质量差距比预期更小。
一位用户分享了他们在 RTX 5090 上运行 Qwen 3.6 27B 的 llama.cpp 服务器配置,达到了 80-100 t/s 的速度,并向社区询问其他设置和技巧。
llama.cpp 的一个 PR 提议将 Intel Battlemage 上的量化 KV 解码从 VEC 切换到 TILE SYCL 内核,据报道在 118K 上下文下解码速度提升最高约 169%。该 PR 目前处于开放状态,存在一些注意事项,且独立验证有限。
一个 llama.cpp 拉取请求为 Q2_0 × Q8_0 点积添加了 x86 VNNI 实现,在 Bonsai 模型上实现了 3.0–3.6 倍的纯 CPU 加速,内核级逐位精确,且 token 一致性达 99.2%。
使用双 RTX 3090 配置的用户发现,llama.cpp 的 `--split-mode tensor` 会在 CPU 上运行提示处理(约 400 t/s),而切换到 `--split-mode layer` 则可解锁 GPU 提示处理,速度超过 1600 t/s,且 token 生成速度仅略有下降。
A developer benchmarks Qwen3.6-35B-A3B Q6 on an RTX 3090, showing that offloading eight MoE expert layers to CPU and increasing batch sizes improves prompt processing by 2.36× (564→1330 tok/s) with no decode speed regression, using evolutionary search to find the tuning config.
详细测试和调优,以在RTX 3090上优化GGUF格式的DeepSeek-V4-Flash-0731,通过不同的量化和加载参数,在128K上下文下达到约15 tok/s。
Qwen3-TTS 语音克隆已合并到 llama.cpp 主线,通过 llama-tts 二进制文件,利用短参考音频即可在本地实现文本转语音和语音克隆,支持多种语言。目前仍有限制,包括仅支持 Base 模型,且尚无服务器端点。
Liquid AI 发布了 LFM2.5-2.6B,这是一个 2.69B 参数模型,支持 128K 上下文和工具调用,专为多步骤智能体工作流优化,可在手机上以 30 tok/s 运行,Q4_K_M GGUF 文件约 1.67GB。不过,与更大的模型相比,其在编码和知识密集型任务上仍然较弱。
一个 llama.cpp PR 将采样从 CPU 移至 GPU,在 RTX 5090 上为 Qwen3.6-35B 推理带来 8% 的 token 速度提升,在 Tesla P40 上约为 4%。
DeepSeek-V4-Flash-0731 以 GGUF 格式发布,每权重 2.88 比特(95 GiB),使 284B 参数的 MoE 模型可在 128 GB 机器上运行。附带详细的操作指南,以及所需的 TurboQuant llama.cpp 分支。
一个 GitHub 补丁通过侧载 antirez 的 llama.cpp 分支,解决了结构布局漂移、解码拆分和代码签名问题,从而允许在 128GB Mac 上的 LM Studio 中运行 DeepSeek V4 Flash。
llama.cpp 已为 DeepSeek V4 Flash 添加 MTP/DSpark 支持,从而通过流行的 C/C++ LLM 运行时实现本地推理。
这则 PSA 提醒 DeepSeek-V4-Flash-0731 用户:系统角色消息会被提升到最顶部,破坏提示缓存和邻近性,并建议改用 latest_reminder。
此 Hugging Face 模型卡片介绍了 LiquidAI 的 LFM2.5-2.6B 模型(GGUF 量化格式),并提供了通过 llama.cpp、vLLM、Ollama 等工具在本地运行的说明。
Unsloth 发布了 DeepSeek-V4-Flash-0731 的 IQ3 GGUF 量化版本,支持通过 llama.cpp、Ollama、LM Studio 等工具进行本地推理。
bigedgeonmoe开源代码库的创建者使得在移动设备和消费级PC上运行大规模MoE模型(高达120B参数)成为可能,在中端手机上实现了Qwen 35B模型每秒6个token的速度。
针对 MindControl(一种用于 llama.cpp 的采样器级引导推理预算)的基准测试结果显示出,多阶段信号传递可以在不损失准确率的情况下减少 token 消耗,并且在较简单任务上有时还能提升准确率。
一位用户分享了在双 GPU(RTX 4090 和 RTX 5060 Ti)上运行大语言模型(Qwen 27B-122B)的基准测试结果,实现了极高的 token 生成速度(例如 35B-A3B 达到 206 t/s,122B 达到 37-41 t/s)。帖子包含配置详情以及指向 GitHub 仓库的链接,其中包含脚本和原始数据。
详细对比了三种本地AI运行时——Ollama、LM Studio和llama.cpp,从界面、API兼容性、量化控制等方面帮助从业者根据自己的工作流程选择合适的工具。