@wherecall1: 3060 12G 跑 Qwen3.8-27B-Unleashed(无审查)安装踩坑记录,每个坑都标了解法,照着做即可复现。 ① 选版本 仓库:outsourc-e/Qwen3.8-27B-Unleashed-GGUF,9 个量化档。306…

X AI KOLs Timeline 工具

摘要

本文提供了在3060 12G显卡上运行Qwen3.8-27B-Unleashed模型的详细安装指南,涵盖版本选择、下载问题和启动配置,并总结了常见错误的解决方法。

3060 12G 跑 Qwen3.8-27B-Unleashed(无审查)安装踩坑记录,每个坑都标了解法,照着做即可复现。 ① 选版本 仓库:outsourc-e/Qwen3.8-27B-Unleashed-GGUF,9 个量化档。3060 12G 选 UD-IQ3_XXS(10.97GB)——能全进显存的最高档,质量/显存平衡点。Q3_K_XL 虽更好但 13.2GB 装不下,Q2 档质量掉太多。 ② 下载(关键坑) HF 直连超时,必须走代理: # 找到本机代理端口(系统设置→代理,或 netstat 查 50830 之类) export https_proxy=http://127.0.0.1:50830 http_proxy=http://127.0.0.1:50830 hf download outsourc-e/Qwen3.8-27B-Unleashed-GGUF --include "*UD-IQ3_XXS*" --local-dir D:/tmp/qwen-unleashed 大文件可能中途停滞(实测 6.4G 卡 15 分钟),杀掉重跑即可,hf CLI 自动断点续传。 ③ llama.cpp 启动 llama-server.exe -m "D:\tmp\qwen-unleashed\Qwen3.8-27B-Unleashed-UD-IQ3_XXS.gguf" ^ --alias qwen3.8-27b-unleashed -ngl 99 -c 65536 ^ --cache-type-k q4_0 --cache-type-v q4_0 ^ --jinja --reasoning-format auto --host 127.0.0.1 --port 8080 参数说明:-ngl 99 全层进 GPU;-c 65536 上下文 64K;KV 压 q4_0 省显存;--jinja 正确解析思考/工具模板。API 兼容 OpenAI + Anthropic 格式。 ④ 踩过的坑 - Windows 路径反斜杠被 Python 转义吞掉(D:\ai-tools→D: i-tools),写 bat 用 raw string:r'''...''' - 12G 显存装不下两个 27B,换模型前先停旧服务(taskkill //PID <pid> //F) - 加载日志的 blk.64 unused tensor 警告是混合架构正常现象,忽略 ⑤ 验证 curl http://127.0.0.1:8080/v1/chat/completions -H "Content-Type: application/json" -d @test.json 实测:敏感提示无拒答,生成速度 ~20.5 tok/s
查看原文
查看缓存全文

缓存时间: 2026/08/23 03:31

3060 12G 跑 Qwen3.8-27B-Unleashed(无审查)安装踩坑记录,每个坑都标了解法,照着做即可复现。

① 选版本 仓库:outsourc-e/Qwen3.8-27B-Unleashed-GGUF,9 个量化档。3060 12G 选 UD-IQ3_XXS(10.97GB)——能全进显存的最高档,质量/显存平衡点。Q3_K_XL 虽更好但 13.2GB 装不下,Q2 档质量掉太多。

② 下载(关键坑) HF 直连超时,必须走代理:

找到本机代理端口(系统设置→代理,或 netstat 查 50830 之类)

export https_proxy=http://127.0.0.1:50830 http_proxy=http://127.0.0.1:50830 hf download outsourc-e/Qwen3.8-27B-Unleashed-GGUF –include “UD-IQ3_XXS” –local-dir D:/tmp/qwen-unleashed 大文件可能中途停滞(实测 6.4G 卡 15 分钟),杀掉重跑即可,hf CLI 自动断点续传。

③ llama.cpp 启动

llama-server.exe -m “D:\tmp\qwen-unleashed\Qwen3.8-27B-Unleashed-UD-IQ3_XXS.gguf” ^ –alias qwen3.8-27b-unleashed -ngl 99 -c 65536 ^ –cache-type-k q4_0 –cache-type-v q4_0 ^ –jinja –reasoning-format auto –host 127.0.0.1 –port 8080 参数说明:-ngl 99 全层进 GPU;-c 65536 上下文 64K;KV 压 q4_0 省显存;–jinja 正确解析思考/工具模板。API 兼容 OpenAI + Anthropic 格式。

④ 踩过的坑

  • Windows 路径反斜杠被 Python 转义吞掉(D:\ai-tools→D: i-tools),写 bat 用 raw string:r’‘’…‘’’
  • 12G 显存装不下两个 27B,换模型前先停旧服务(taskkill //PID //F)
  • 加载日志的 blk.64 unused tensor 警告是混合架构正常现象,忽略

⑤ 验证 curl http://127.0.0.1:8080/v1/chat/completions -H “Content-Type: application/json” -d @test.json 实测:敏感提示无拒答,生成速度 ~20.5 tok/s

相似文章