@wherecall1: 3060 12G 跑 Qwen3.8-27B-Unleashed(无审查)安装踩坑记录,每个坑都标了解法,照着做即可复现。 ① 选版本 仓库:outsourc-e/Qwen3.8-27B-Unleashed-GGUF,9 个量化档。306…
摘要
本文提供了在3060 12G显卡上运行Qwen3.8-27B-Unleashed模型的详细安装指南,涵盖版本选择、下载问题和启动配置,并总结了常见错误的解决方法。
查看缓存全文
缓存时间: 2026/08/23 03:31
3060 12G 跑 Qwen3.8-27B-Unleashed(无审查)安装踩坑记录,每个坑都标了解法,照着做即可复现。
① 选版本 仓库:outsourc-e/Qwen3.8-27B-Unleashed-GGUF,9 个量化档。3060 12G 选 UD-IQ3_XXS(10.97GB)——能全进显存的最高档,质量/显存平衡点。Q3_K_XL 虽更好但 13.2GB 装不下,Q2 档质量掉太多。
② 下载(关键坑) HF 直连超时,必须走代理:
找到本机代理端口(系统设置→代理,或 netstat 查 50830 之类)
export https_proxy=http://127.0.0.1:50830 http_proxy=http://127.0.0.1:50830 hf download outsourc-e/Qwen3.8-27B-Unleashed-GGUF –include “UD-IQ3_XXS” –local-dir D:/tmp/qwen-unleashed 大文件可能中途停滞(实测 6.4G 卡 15 分钟),杀掉重跑即可,hf CLI 自动断点续传。
③ llama.cpp 启动
llama-server.exe -m “D:\tmp\qwen-unleashed\Qwen3.8-27B-Unleashed-UD-IQ3_XXS.gguf” ^ –alias qwen3.8-27b-unleashed -ngl 99 -c 65536 ^ –cache-type-k q4_0 –cache-type-v q4_0 ^ –jinja –reasoning-format auto –host 127.0.0.1 –port 8080 参数说明:-ngl 99 全层进 GPU;-c 65536 上下文 64K;KV 压 q4_0 省显存;–jinja 正确解析思考/工具模板。API 兼容 OpenAI + Anthropic 格式。
④ 踩过的坑
- Windows 路径反斜杠被 Python 转义吞掉(D:\ai-tools→D: i-tools),写 bat 用 raw string:r’‘’…‘’’
- 12G 显存装不下两个 27B,换模型前先停旧服务(taskkill //PID
//F) - 加载日志的 blk.64 unused tensor 警告是混合架构正常现象,忽略
⑤ 验证 curl http://127.0.0.1:8080/v1/chat/completions -H “Content-Type: application/json” -d @test.json 实测:敏感提示无拒答,生成速度 ~20.5 tok/s
相似文章
@9hills: Qwen3.8-27B 本地部署指南 1. Q4 基本没有质量损失,甚至可以用Q3 2. 用Unsloth的GGUF。 3. 思考开low就行了。 4. 开 dflash2
本文提供了 Qwen3.8-27B 模型的本地部署指南,推荐使用 Q4 量化和 Unsloth GGUF 工具,并分享了与 FP8 基准相比较的性能测试结果。
@shangdu2005: 比上个版本更加无敌的。 Qwen3.8 27B越狱无审查版本。 这两个自行测试,谨慎使用。 1.orcarouter https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored-FP8…
本文介绍了一个未审查的Qwen3.8 27B AI模型,该模型经过修改以移除安全限制,并量化为FP8以提高效率,适用于研究目的。
@KtAIFeed: 直接上干货,不废话。 最近火爆 Hugging Face(单月下载超百万)的 Qwen 3.6(35B/43B)最新开源“无限制”模型,最低单卡 6G 显存就能在本地跑起来,彻底砸碎了官方原版的道德说教和安全限制,无审查,你聊它就回答什么…
介绍Qwen 3.6(35B/43B)开源无限制模型,移除官方道德与安全限制,最低6G显存即可本地运行,下载量超百万。
@seclink: 这家伙刚刚在一块单张 3090 显卡上,跑出了 Qwen 3.5-27B Dense 模型 134 tok/s 的速度,以及新版 Qwen 3.6-27B 模型 73 tok/s 的速度。2026 年的开源社区,其发展速度简直如神速一般。…
A single RTX 3090 achieves 134 tok/s on the new 27B Qwen 3.5 Dense and 73 tok/s on Qwen 3.6-27B using fused kernels and speculative decoding, with same-day GGUF releases.
@Lonely__MH: 为所欲为! Qwen3.8-27B 剥离安全限制的无审查版本来了! 为社区速度点赞!专为 Mac M芯片深度优化! 看大家都在讨论 ling-3.0-flash 的 DGX Spark 部署,很多人第一反应都是算力太贵买不起 既然云端成本…
Qwen3.8-27B 无审查版本发布,专为 Mac M 芯片优化,支持本地部署,保留多模态能力和安全研究功能,提供简化安装步骤。