@ggerganov:llama-server -hf ggml-org/Qwen3.6-27B-GGUF --spec-default
摘要
Georgi Gerganov 分享了一条一行命令,用 llama-server 以默认投机解码设置启动量化版 27B Qwen3.6 模型。
llama-server -hf ggml-org/Qwen3.6-27B-GGUF --spec-default
查看缓存全文
缓存时间: 2026/04/22 17:02
llama-server -hf ggml-org/Qwen3.6-27B-GGUF –spec-default
相似文章
Qwen3.6 27b / llama.cpp / opencode 最佳配置
社区讨论帖,分享在多 GPU 环境下运行 27B Qwen3.6 GGUF 模型、支持 100K-512K 长上下文的 llama.cpp 优化启动命令。
在24GB显存环境中运行Qwen 3.6 27B的配置:后端对比、量化选择与设置(llama.cpp, ik_llama.cpp, BeeLlama, vllm)
本文对比了在RTX 3090 24GB上运行Qwen 3.6 27B使用的llama.cpp后端,发现搭配IQ4_KS量化的ik_llama.cpp性能最佳(预填充1261 tok/s,解码72.9 tok/s)。
Qwen3.6 27B 在 vLLM 中的表现比在 llama.cpp 中更差
一名用户报告称,Qwen3.6-27B 模型在使用 llama.cpp 时比使用 vLLM 表现更好且更可靠,并指出尽管进行了大量配置,vLLM 仍出现工具调用错误和“被切除脑叶”的行为。
@WaleedAhmad1a10: 查看 Qwen 3.5 27B MoQ 的 GGUF 文件:
Hugging Face 仓库 (kaitchup/Qwen3.6-27B-GGUF-MoQ) 提供了 Qwen3.6-27B MoQ 模型的 GGUF 量化权重,支持使用 llama.cpp 和 Ollama 等工具进行本地推理。
@MiaAI_lab:如果你在寻找一个简单的启动/停止脚本来运行你的 Qwen3.6 27B/35B,可以看看这个。它针对速度进行了优化……
MiaAI-Lab 提供了一个简单的 Bash 启动/停止脚本,用于通过 llama-server 运行 Qwen3.6 27B/35B GGUF 模型,针对速度和编码性能进行了优化。