标签
关于在两块RTX 4090 GPU上使用llama.cpp并发运行多个AI代理的基准测试报告,揭示了性能限制和Qwen模型的最佳配置。
本文讨论了在Strix Halo硬件上优化性能的官方llama.cpp替代方案,其中特定分支在AI推理任务中实现了显著更高的吞吐量。
作者推荐ExLlamaV3,这是一个被低估的本地AI推理工具,在NVIDIA硬件上性能优于llama.cpp,最近的更新如CPU MoE卸载提升了其性能。
一种 llama.cpp 实现,可在推理阶段通过自适应阈值与分层线性衰减将 MoE 专家路由扩展至原生 top-K 之外,无需重新训练或微调。
一位开发者构建了 llama.cpp 的自定义分支,为混合专家(MoE)模型实现了专家扩展功能,已在 Metal 上完成测试,现寻求跨平台反馈。
一个 GitHub 拉取请求为 llama.cpp C/C++ 推理库添加了 Tencent Hy 4 (hy_v4) 预览架构支持,使此新模型能够进行本地推理。
Unsloth AI 宣布对 GLM-5.3-Flash 进行优化,实现1.6–3.4倍更快的本地 GGUF 推理,支持多令牌预测和运行本地模型的硬件要求。
文章详细描述了将 Multi-Token Prediction (MTP) 支持合并至 ik_llama.cpp 的过程,这显著提升了 Qwen3.8-Flash-Next 模型的令牌生成速度,基准测试显示在高端硬件上速度最高可提升一倍。
这是K2-Horizon-MoVA-36B-A4B模型的GGUF版本,一个具有36B总参数和每令牌4B活动参数的混合专家AI模型,针对llama.cpp使用进行了优化。它在代理和推理基准测试中展示了前沿级别的性能,与更大和封闭的模型竞争。
展示了在2026年,即使在显卡性能不足的情况下,也能通过量化版Qwen3.6-35B模型在低端笔记本电脑上用24分钟构建类塞尔达RPG游戏。
用户基准测试并详述了 llama.cpp 中的 GPU 常驻专家缓存 PR,该 PR 将 Qwen3.8-Flash-Next 在双 RTX 3090 系统上的解码速度从 17 提升至 25-29 令牌/秒。
这条推文分享了腾讯 Hy4-preview 模型的 GGUF 构建版本,包括量化版本以及使用经过修补的 llama.cpp 运行它们的说明。
一名用户质疑MLX在Apple M5芯片上的相关性,因为llama.cpp的Metal更新提升了GGUF模型的预填充性能,使得MLX在某些任务上可能变得冗余。
DeepSeek-V4-Flash-Vision-Exp 模型的视觉支持功能已成功整合到 llama.cpp 框架中,这显著提升了其在多模态人工智能推理方面的能力。
展示了Qwen3.8-27B AI模型在12GB RTX 3080 Ti GPU上的性能,使用llama.cpp在特定量化设置下,在128K上下文中达到每秒47个令牌。
用户分享了基准测试结果,显示 vLLM 的预填充性能显著快于 llama.cpp 和其他引擎,并质疑这种速度差异背后的技术原因。
Vellium v1.1.0 引入实时语音聊天功能,支持使用 Whisper 和 TeraTTSv2 进行本地 STT/TTS,并简化了 llama.cpp 设置,以便更轻松地与本地 AI 模型集成。
一位用户展示了使用LLAMA.cpp,Qwen 3.8 27b AI模型能在单次提示下生成一个完全独立的超级马里奥克隆游戏,在Windows PC和Macbook M5 Air上用时117分钟完成该任务。
Qwen3.8-Flash-Next-GGUF 模型的 MTP 已发布,并提供了与 llama.cpp、vLLM 和 Ollama 等推理工具集成的详细部署说明。