llamacpp

标签

Cards List
#llamacpp

大家在 Qwen3.6 27b 上跑出来的速度是多少?

Reddit r/LocalLLaMA ↗ · 2026-04-22

用户基准测试 Qwen3.6-27B-Q8_0,在 3 块混合 GPU 上通过 llama.cpp 以约 13 tokens/sec 运行 128k 上下文,询问该性能是否典型。

0 人收藏 0 人点赞
#llamacpp

ggml-cpu:pl752 提交的 x86 与通用 CPU q1_0 点积优化(后续)· Pull Request #21636 · ggml-org/llama.cpp

Reddit r/LocalLLaMA ↗ · 2026-04-21 缓存

该 PR 为 ggml-cpu 加入针对 x86 及通用 CPU 优化的 q1_0 点积内核,提升量化 LLM 推理速度。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈