Qwen 3.6 27B:本地开发的理想之选
摘要
Qwen 3.6 27B 被赞誉为强大的本地 AI 模型,在通用智能方面超越预期,适用于代码生成等实际任务,并能通过 llama.cpp 轻松运行。
暂无内容
查看缓存全文
缓存时间: 2026/06/29 20:06
# Qwen 3.6 27B 是本地开发的甜蜜点
来源:https://quesma.com/blog/qwen-36-is-awesome/
过去我对本地模型一直很失望。但当我试了 Qwen 3.6,立刻被震撼了。对我来说,这是第一个真正有通用智能感的本地模型。
它有两个版本:混合专家模型 [Qwen 3.6 35B A3B](https://huggingface.co/Qwen/Qwen3.6-35B-A3B) 和密集模型 [Qwen 3.6 27B](https://huggingface.co/Qwen/Qwen3.6-27B) —— 较慢,但更强。我推荐后者!
让我分享我的感受,并告诉你如何也能运行它。
热成像图片
它真的很热,字面意义上的。当我的膝盖开始融化时,我抓起一个手机外接 [热成像相机](https://github.com/stared/thermal-upscale) 拍了张照片。
Qwen 3.6 在 [Hacker News](https://hn.algolia.com/?dateEnd=1782305498&dateRange=custom&dateStart=1775001600&page=0&prefix=true&query=qwen&sort=byPopularity&type=story) 上获得了大量关注,这是理所当然的。关于 Qwen 3.6 27B 最常见的评价是它“超常发挥”——参见 [Will it Mythos?](https://swelljoe.com/post/will-it-mythos/)。我认为这一评价当之无愧。它会让你的电脑发热,但值得!
## 试探水温
Simon Willison 使用“企鹅骑自行车”作为冒烟测试(见 [Qwen 3.6 35B A3B](https://simonwillison.net/2026/Apr/16/qwen-beats-opus/) 然后是 [Qwen 3.6 27B](https://simonwillison.net/2026/Apr/22/qwen36-27b/))。我通常用限制性写作来测试。
与 Qwen 3.6 讨论量子力学
一年前,这种事情还是最前沿的水平,需要独特且极其昂贵的 GPT-4.5,参见 [vibe translating Quantum Flytrap](https://p.migdal.pl/blog/2025/04/vibe-translating-quantum-flytrap/)。
我还让它写一首关于 Zouk 舞蹈和量子物理的 8 行诗,见 [对话记录](https://gist.github.com/stared/bac79cd053ea5443abcf58e622c083b7)。它的思考过程很合理,无论是对量子术语的斟酌还是押韵。
然后我让它在 OpenCode 中用 `pnpm` 创建一个六边形扫雷游戏。它成功了:
用 Qwen 3.6 27B 在 OpenCode 中生成的六边形扫雷
第一次就成功了,只用了一个提示,就生成了正确的 Node 包。混合专家模型 Qwen 3.6 35B A3B 更快……但忽略了我创建包的要求,而是在单个 `index.html` 中完成了。
## 实际工作
当然,关于量子力学的创意写作,或者又一个扫雷克隆版,通常不是日常的工作。但 Qwen 3.6 27B 在常规任务上也很出色。
Maciej Cielecki 的蜡烛商店提示在 OpenCode 中运行
由我的朋友 [Maciej Cielecki](https://cielecki.com/) 在 [AI Tinkerers Warsaw](https://poland.aitinkerers.org/) 活动中提供的提示。
它运行了几分钟,生成了这个:
Qwen 3.6 生成的落地页
按照当前前沿模型的标准,这并不起眼。但它已经是一个实际可用的工作成果。它正常工作、有交互、默认样式也不错——全部来自一个简短的提示。
## 使用 llama.cpp 本地运行 Qwen 3.6
运行本地模型比以往任何时候都简单。几条命令行就能搞定。
我推荐 [llama.cpp](https://github.com/ggml-org/llama.cpp) —— 一个直接、开源的工具,可以在各种设备上运行模型。你不需要 Ollama,而且坦率地说——[基于伦理原因我会建议不要使用它](https://sleepingrobots.com/dreams/stop-using-ollama/)。
首先,我们前往 Hugging Face 获取合适的量化版本,即缩小尺寸的模型 —— 流行的有 [unsloth](https://huggingface.co/unsloth/Qwen3.6-27B-GGUF) 或 [bartowski](https://huggingface.co/bartowski/Qwen_Qwen3.6-27B-GGUF) 等。默认模型通常是 `BF16` 精度。常见的 8 位量化能节省一半空间,且质量几乎无损。再往下,模型更小(可能更快),但会牺牲质量,参见 [这个 27B 对比](https://www.reddit.com/r/LocalLLaMA/comments/1tr9vzn/qwen3627b_quantization_benchmark/) 和 [另一个 35B A3B 对比](https://huggingface.co/unsloth/Qwen3.6-35B-A3B-GGUF/discussions/10)。
我们获取 `unsloth/Qwen3.6-27B-MTP-GGUF:Q8_0`(https://huggingface.co/unsloth/Qwen3.6-27B-MTP-GGUF),这是一个支持多令牌预测(MTP)的 8 位量化版本。
```
llama-server -hf unsloth/Qwen3.6-27B-MTP-GGUF:Q8_0 \
--spec-type draft-mtp -ngl 999 -fa on -c 65536 --jinja --port 8080
```
各参数含义:
- `-hf unsloth/Qwen3.6-27B-MTP-GGUF:Q8_0` 从 Hugging Face 拉取模型,后续运行会复用
- 如果已有模型,可使用 `-m ~/models/Qwen3.6-27B-Q8_0.gguf` 代替
- `draft-mtp` 使用快速模型预测后续令牌,加快速度
- `-ngl 999` 将所有层放到 GPU
- `-fa on` 启用 Flash Attention
- `-c 65536` 上下文大小设为 64k tokens(可调整,Qwen 3.6 27B 原生上下文为 256k)
- `--jinja` 支持工具调用
- `--port 8080` 固定端口,便于其他配置使用
如果你打开 `http://127.0.0.1:8080`,就可以直接与之对话了。
同样的服务器也可用于 vibe coding。代理的选择取决于个人目标和主观偏好 —— 对于全能型 OpenCode、极简的 Pi、以及自我改进的 Hermes。
对于 OpenCode,只需在 `~/.config/opencode/opencode.jsonc` 中添加:
```json
{
"$schema": "https://opencode.ai/config.json",
"provider": {
"llama": {
"name": "llama.cpp (local)",
"npm": "@ai-sdk/openai-compatible",
"options": {
"baseURL": "http://127.0.0.1:8080/v1",
"apiKey": "local"
},
"models": {
"qwen3.6-27b": { "name": "Qwen3.6-27B Q8 +MTP" }
}
}
},
"model": "llama/qwen3.6-27b"
}
```
如果你只是想聊天并且是终端的狂热粉丝,可以用 `llama-cli` 代替 `llama-server`:
```
llama-cli -hf unsloth/Qwen3.6-27B-MTP-GGUF:Q8_0 \
-ngl 999 -fa on -c 65536 --jinja
```
## 性能测试
它足够快吗?
我在我的 Macbook Max M5 128 GB 上运行了一些测试([源码在此](https://github.com/stared/benching-local-llms-on-apple-silicon)),测试了开启和不开启多令牌预测的情况,并与 35B A3B 模型以及量化版的 DeepSeek V4 Flash([DwarfStar4](https://github.com/antirez/ds4))进行了对比。
DeepSeek-V4-Flash· Q2–Q4
每秒 30 个 tokens 并不差,[完全处于典型前沿模型 API 的范围内](https://openrouter.ai/openai/gpt-5.5#performance)。虽然 [mlx-lm](https://github.com/ml-explore/mlx-lm) 专门针对 Apple Silicon 设备优化,且 AI 代理强烈推荐它,但 llama.cpp 实际上更快。它使用了 95% 的 GPU,说明资源利用率很高。
Macbook Max M5 是一台性能怪兽(至少对于笔记本而言),其他设备上应该也能运行得不错。对于消费级的 Nvidia RTX 显卡,一方面模型需要量化,另一方面它甚至更快。
> 我今天在 5090 上设置为 Q6_K 量化和 Q4_0 KV,在 123k 上下文下稳定 50 tokens/s,使用了约 28/32 GB 显存(通过 LM Studio)。—— gfosco 在 Hacker News 上的评论
虽然 35B A3B 快 3 倍,但我更喜欢 27B。我宁愿生成少两倍的代码,但质量更高。
## 它们与之前最先进的模型相比如何?
人工检查很棒,但基准测试有助于形成直观感受。以下是 [Artificial Analysis](https://artificialanalysis.ai/) 的评分,与前沿模型对比:
Gemma 4 31B
≈ 2024 年末
o1 / Claude 3.5 Sonnet
Qwen3.6-35B-A3B
≈ 2025 年初
o3 / Claude 4 Sonnet
Qwen3.6-27B
≈ 2025 年中
GPT-5 / Claude Sonnet 4.5
DeepSeek-V4-Flash
≈ 2025 年末
GPT-5.2 / Claude Opus 4.5
更多基准测试见 [这些笔记](https://github.com/stared/benching-local-llms-on-apple-silicon),但总体趋势相似。这里加入了 [Gemma 4 31B](https://deepmind.google/models/gemma/gemma-4/),因为很多人将其作为本地编码的默认模型。但无论是基准测试还是网络上的普遍看法,都明显更偏向 Qwen 3.6 27B。
需要说明的是——8 位量化可能对结果影响不大,但 DwarfStar4 对 DeepSeek V4 Flash 使用了更激进的量化(2-4 位)。它肯定不如完整模型。我个人的印象是,在这些量化程度上,Qwen 3.6 27B 与 DwarfStar4 相当(甚至略好)。不过,对于长上下文项目,如果 DS4 有优势,我也不会感到惊讶。
## 下一步
我认为我们正在进入一个迷人的时代——运行自己的模型变得可行。
这一变化还将因专有前沿模型的现状而进一步加速。Claude Fable 5 已被下架。其他前沿模型运行在巨额补贴之下,每月支付 100 美元就能获得价值数千美元的 tokens。趁折扣还在,好好利用吧!
本地部署的模型可以根据我们的需求进行微调,并且不会被夺走。企业可以将其用于专有和敏感数据。我们个人可以将其用于离线项目,或者当我们不愿与美国或中国分享最深层的秘密或医疗数据时。
随着 [前沿级开源权重 GLM 5.2](https://artificialanalysis.ai/articles/glm-5-2-is-the-new-leading-open-weights-model-on-the-artificial-analysis-intelligence-index) 的发布,一个新时代到来了。虽然 Qwen 3.6 是垫脚石,但就连前沿的 [GLM 5.2 也可以本地运行](https://unsloth.ai/docs/models/glm-5.2)。它不能在 Macbook 或单张 RTX 5090 上运行,但仍然可以在公司预算范围内管理。
此外,我坚信我们将会拥有比当前最先进模型更智能的模型,同时能在本地设备(甚至智能手机)上运行。当前模型将原始智能和事实知识混合在相同的权重中。未来的模型很可能会将它们分开,将大量知识外包给工具调用。
相似文章
Qwen 3.8 27B 表现优异,但默认启用过度推理模式
Qwen 3.8 27B 是阿里巴巴通义千问实验室推出的一款强大的开源270亿参数多模态大语言模型。它在基准测试中表现突出,但被批评默认启用过度推理模式,这在消费级硬件上拖慢了运行速度。
Qwen 3.8 27B 用于实际的本地编程
本文探讨了 Qwen 3.8 27B 本地 AI 模型是否能够处理实际的系统编程任务,例如使用 Rust 或 C++ 以及外部库构建 GTK4 或 Qt 6 应用程序。
Qwen 3.8 27b 发布:本地AI的重大新闻
Qwen 3.8 27b,一个参数小于300亿的AI模型,已经发布,适合在消费级硬件如RTX 3090或M4 Pro上进行本地推理,有可能取代基于云的AI订阅,并将工作流程转移到本地。
Qwen 3.8 27b 即使在 Q3_xxs 下也很强大
用户发现 Qwen 3.8 27b 在 Q3 量化下对编码任务非常高效,推理速度快,超越了之前的模型,尽管在日常对话中存在一些小问题。
在 8GB 显存和 32GB 内存上运行 Qwen3.6 35b a3b,~190k 上下文
作者分享了一种高性能的本地推理配置,使用支持 TurboQuant 的修改版 llama.cpp,在硬件受限(8GB 显存、32GB 内存)的情况下运行 Qwen3.6 35B A3B,实现了 ~37-51 tok/sec 的生成速度,并支持 ~190k 上下文。