标签
DFlash2 的支持已通过拉取请求 #27342 合并到 llama.cpp 中,为 LLM 推理工具添加了局部卷积和候选选择器功能。
作者构建了一个开源的本地大语言模型运行框架,以 Qwen 27b 为基础,支持即时代码审查、子代理、语音听写等功能,并分享了开发心得。
本文对Qwen3.8-Flash-Next模型进行了基准测试,显示其在个人基准测试中突破了94%,并比较了其在编程、通用知识和科学方面与其他模型的性能。
本文介绍了一种自定义的MCP设置,允许在同一会话中使用如llama.cpp等工具,将编码任务从Anthropic的Claude模型卸载到本地的Qwen3.8-27B模型。
本文发布未经审查的 Qwen3.8-Flash-Next 模型的 GGUF 量化版本,这是 Qwen4 架构的混合专家模型预览版,专为支持视觉功能的 llama.cpp 设计,需要自定义构建以确保兼容性。
本指南说明如何配置llama.cpp的DFlash2推测解码,以在配备16GB显存的RTX 4080 GPU上实现Qwen3.8-27B模型最高1.72倍的推理速度提升。
本文讨论了关于Hugging Face收购llama.cpp/ggml的担忧,探索了对人工智能生态系统的潜在风险,以及许可证保护和社区意见的问题。
用户通过禁用运行时电源管理,解决了在无头 Linux 系统上使用 AMD GPU 运行大型 AI 模型时崩溃的问题,防止模型权重被转储到有限内存中导致 OOM 错误。
llama.cpp 项目在 llama.app 推出了新的官方文档网站,提供使用 llama cli 和 llama server 进行本地 LLM 推理的全面指南。
本文讨论了 llama.cpp 的一个 AMD 特定分支,该分支显著提升了 AMD 用户的提示处理速度,使用 ROCm/Hip 时,在密集模型上性能最高提升 2 倍,尽管在其他指标上有些权衡。
作者在配备128GB内存的系统上实验运行DeepSeek-V4-Flash-0731的4位量化模型,通过内存锁定和提示处理策略等优化手段,达到了可接受的推理速度。
已创建一个 llama.cpp 的分支,并针对 AMD GFX906 GPU 进行了优化,提升了 Mi50、Mi60、Radeon VII 和 GCN HIP 上的性能,适用于机器学习和大语言模型应用。
一位用户fork了Ninfer推理引擎以在CMP170HX GPU上运行,使llama.cpp的Qwen3.6-35B模型性能翻倍,并分享了配置细节。
本文提供了在3060 12G显卡上运行Qwen3.8-27B-Unleashed模型的详细安装指南,涵盖版本选择、下载问题和启动配置,并总结了常见错误的解决方法。
Llama.cpp 是一个流行的开源工具,用于运行 LLaMA 模型,现已发布 0.2.0 版本,包含更新日志和预构建二进制文件,可在 GitHub 上获取。
在一个 llama.cpp 分支中实现了 DSpark PC Tree,根据基准测试结果,在 Qwen 3.0 模型上显示了推理速度最高提升29.5%的性能优势。
该基准测试对 llama.cpp 中的 DFlash2 与 MTP 技术进行了比较,结果表明 DFlash2 的令牌生成速度提高了约 20%,但可用上下文减少了 38%。