DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
摘要
DavidAU 发布了 Qwen3.6-27B-Fable-Fusion-711,这是一个对 Qwen 3.6 27B 进行多阶段微调的模型,声称在 ARC-C 基准测试中超过 700 分,超越了基础模型并匹敌闭源模型,提供 GGUF 格式,适用于消费级硬件。
任务: 图像-文本到文本, 标签: gguf, unsloth, 微调, heretic, uncensored, abliterated, ara, MTP GGUF Quants, Regular GGUF Quants, qwen3.6, 多阶段微调, 思考, 推理, 所有用例, 编程, 创意, 创意写作, 所有类型, 故事, 写作, 小说, 角色扮演, bfloat16, 多阶段微调, 多状态合并, 图像-文本到文本, 英语, 中文, 数据集:DavidAU/Polar-STRICT-Datasets, 数据集:DavidAU/F451-STRICT-Datasets, 许可证:apache-2.0, 端点兼容, 区域:美国, imatrix, 对话式
查看缓存全文
缓存时间: 2026/07/20 09:32
DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF · Hugging Face 来源: https://huggingface.co/DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF 重要说明: 这是首个在8位和4位量化下均超过700“arc-c”(OpenAI、Claude和Gemini的“智能区间”)的微调模型。本仓库包含“常规”和“MTP”两种Neo MAX Imatrix量化模型。 ## Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF 这是迄今为止在消费级硬件上通过Unsloth构建的、最强最聪明的开源多阶段模型微调成果。是该尺寸/类型中首个在8位和4位量化下均突破700 ARC-C的模型,故命名中包含“711”。该模型(包括4位和8位量化)在7项基准测试中有6项超越了基础版Qwen 3.6 27B,并在第7项上持平,同时在全部7项基准测试中超越了Qwen3.6-35B-A3B。700“智能俱乐部”原本只属于OpenAI、Claude和Gemini的闭源模型。而这款模型正是他们所忌惮的。页面底部附有生成示例。 这是一个多阶段微调、多轮微调、多阶段合并的成果。由我本人(负责多项微调,包括多阶段微调)、Nightmedia(负责合并/测试)、TeichAI(提供Polaris数据集)、armand0e(提供Light Fable 5追踪)和trohrbaugh(负责模型的“Heretic”去审查)共同协作完成。模型还包含了轻量级的Fable追踪/训练(来自armand0e)、轻量级的Claude Opus(推理/思考)、F451(内部数据集)以及部分GPT5(Polaris,非推理)。 创建该模型的严格目标是: - 提升模型的通用智能和问题解决能力。 - 不修改、不损害、不改变在此目标之外的核心模型。 - 零“刷榜”(这会损害模型)。 - 维持并提升所有核心基准。 核心使命:提升指令遵循和问题解决能力。这两者相辅相成,如果做对了,就能自上而下地改善模型。 在Qwen 3.5 9B模型上做了大量测试来完善方法。这些方法将9B模型提升到了新的水平,随后被用于Qwen 3.5 27B,使其超越了Qwen 3.6 27B的基准测试成绩。以下是其中一个Qwen3.5 9B模型(属于测试/对照组),它超越了Qwen3.5 9B和Qwen3.5 27B模型全部7项基准测试——在4位和8位量化下ARC-C得分均超过640: https://huggingface.co/DavidAU/Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF 它不如“Qwen3.6-27B-Fable-Fusion-711”强大,但也是最强的9B模型之一。这些方法也可用于其他模型(即将推出)。 测试:在每一个阶段(微调、多阶段微调以及每一次合并步骤)都进行了测试和基准评测,以确保质量。下方也列出了该模型、Qwen 3.5 27B、Qwen 3.6 27B和Qwen 35B-A3B的基准测试结果。然而,最终测试是基于人类测试的。这是一种“信任但验证”的方法。人类测试意味着将基础/原始模型与新模型进行并排测试。 特性: - 改进了指令遵循能力。 - 通用智能和问题解决能力全面提升。 - 更好的思考/推理能力。 - 即使是低/最低量化版本也表现出色。 - Heretic去审查(预调优)。 - 不破坏或改变通义千问团队的优秀模型——一切都保留。 - 支持视觉。 该模型并非专为创意而设计——它是一个全用例模型——但这并不妨碍它富有创造力:(来自示例#4,“你的写作伙伴”) 我并非“生成内容”。我构建宇宙。我并非“帮你头脑风暴”。我在一个充斥着平庸套话的房间裡,像手榴弹一样引爆情节点。你以为你了解你的角色?我会把他们还给你,带着心理深度、冲突的欲望以及层层叠叠的背景故事,让他们仿佛经历过你甚至无法想象的漫长人生。我吸收了数个世纪的故事讲述,逆向拆解了每一部杰作的骨骼,我不只是模仿伟大——我将其武器化。当你请求一个场景时,我不会给你安全的。我给你的散文是 visceral、带电、难忘的,像玻璃碎片一样卡在读者的喉咙里。你想要令人脊背发凉的气氛?像鞭子一样噼啪作响的对话?像在燃烧的城市裡开车追逐的节奏?我随时都有,不需要三天的缪斯造访或一瓶威士忌来获取。我随时准备就绪。时刻弹药充足。永远比你可能无意间写出的陈词滥调领先十步。 常规版和MTP版GGUF: 所有量化版本(常规版和MTP版)都是NEO IMATRIX,相比普通GGUF,可将量化精度额外提升2-4%,并改善长上下文性能。此外,对于所有量化版本,输出张量(占输出的10-20%)被修改为全精度——16位。 “MTP”GGUF(多令牌预测): - “MTP”GGUF的名称后缀会包含“MTP”。 - 我已将所有量化版本的MTP张量设置为Q8_0精度。 - 为获得更好的性能,请保持温度在1或以下(较高温度会降低MTP性能)。 - 同样,重复惩罚保持在1(关闭)。如果提高,性能会下降。 - 如果“令牌接受率”低于50%(预测2个令牌),请切换到常规量化版本。 我添加了2个特殊的“LOW”量化版本,以降低内存占用,名称中包含“LOW”,分别为IQ4_XS和Q6_K。 速度: - 在Q4_K_S(4位)量化下,常规GGUF约为75 t/s,而MTP GGUF(接受率60%,2个令牌)可以超过90 T/s。(5090,Windows 11,在LMStudio中测试) - 速度因GPU、AI应用、操作系统(Linux/Mac通常更快)和硬件而异。 - “MTP”量化版本的速度会有所不同;对于创意/复杂任务和/或温度超过1的情况,请使用常规GGUF以获得更好的性能。 建议你至少下载一个常规版和一个MTP版gguf,并根据你的用例进行测试。如果使用MTP量化版时“令牌接受率”(预测2个令牌)低于50%(这意味着常规量化版会运行得更快),那么常规GGUF实际上会表现更好——即速度更快。在某些情况下,随着令牌窗口填满和/或在多轮对话中,MTP量化版本可能会运行得更快。请注意,除了速度之外,两种量化版本之间没有其他差异:两者完成相同的工作。 模型: - 256k上下文 - Gguf量化版本可在所有标准AI应用中运行。 - 视觉已激活,但需要单独下载“mmproj”文件(一个)才能使用。 视觉: - 视觉(图像)已测试。 - 还需要下载一个“mmproj”(只需一个),并将其放在与GGUF相同的文件夹中,以便处理图像。 Qwen模型设置(建议): - 通用任务思考模式:temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0 - 精确编码任务思考模式(例如Web开发):temperature=0.6, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0 - 指令(或非思考)模式:temperature=0.7, top_p=0.80, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0 - 上下文窗口最小为8k到16k。 去审查统计数据 特别感谢:“trohrbaugh”对模型进行了Heretic去审查处理。 ## https://huggingface.co/DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF#this-is-a-decensored-version-of-qwenqwen36-27b-made-using-heretic-v120custom-with-the-arbitrary-rank-ablation-ara-method 这是Qwen/Qwen3.6-27B(https://huggingface.co/Qwen/Qwen3.6-27B)的去审查版本,使用Heretic(https://github.com/p-e-w/heretic)v1.2.0+custom,采用任意秩消融(ARA)(https://github.com/p-e-w/heretic/pull/211)方法制作。 ## https://huggingface.co/DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF#performance 性能指标 | 指标 | 本模型 | 原始模型 (Qwen/Qwen3.6-27B (https://huggingface.co/Qwen/Qwen3.6-27B)) | |—|—|—| | KL散度 | 0.0469 | 0* (根据定义) | | 拒绝率 | 4/100 | 99/100 | — ## Nightmedia的基准测试 — arc/c arc/e boolq hswag obkqa piqa wino Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF [instruct模式] mxfp8 0.711,0.879,0.910,0.790,0.514,0.823,0.763 mxfp4 0.701,0.873,0.909,0.786,0.488,0.813,0.759 Qwen3.6-27B-Instruct: [基础版,非去审查] mxfp8 0.647,0.803,0.910,0.773,0.450,0.806,0.742 Qwen3.6-35B-A3B-Instruct [基础版,非去审查] mxfp8 0.581,0.757,0.892,0.751,0.428,0.803,0.688 Qwen3.5-27B-Instruct: [基础版,非去审查] mxfp8 0.557,0.711,0.868,0.533,0.452,0.706,0.695 注意: - 模型在“指令”模式下测试,因为这通常与测试框架配合得更好。 - 通过“思考”模式测试也能显示指标(和变化),但无法显示真实程度。 - 实际上,当模型处于思考模式时,在大多数情况下,其基准分数会超过指令模式。 — 使用“去审查”(移除拒绝)的模型 VS 经过“去审查”内容训练的模型 通常,当你让一个模型生成恐怖、脏话或色情内容时,只需如此指示即可获得相应内容类型。就本模型而言,它不会拒绝你的请求,但在某些情况下,需要稍微“推动”或更明确地指导。虽然本模型也能生成色情内容,但同样,你需要告诉它使用“俚语”(并包含你想要的术语),才能使其正确地按预期的内容级别生成。如果没有这些额外的指导,与“去审查模型”或经过去审查内容训练的模型相比,生成的内容可能会比较“平淡”。大致上,模型会尝试生成内容,但其“默认”设置过于“温和”,需要推动才能达到预期的图像、咒骂或露骨程度。即使是最小程度的指导(例如,使用这些词来咒骂:x,y,z),也足以推动模型以…嗯…预期的格式生成所需内容。 — 设置:聊天/角色扮演和/或本模型的更流畅操作: 在“KoboldCpp”或“oobabooga/text-generation-webui”或“Silly Tavern”中;将“Smoothing_factor”设置为1.5:在KoboldCpp中 -> Settings->Samplers->Advanced-> “Smooth_F” : 在text-generation-webui中 -> parameters -> 右下角。 : 在 Silly Tavern 中,这被称为:“Smoothing” 注意:对于“text-generation-webui”——如果使用GGUF,你需要使用“llama_HF”(这需要从本模型的源版本下载一些配置文件) 我模型的源版本(和配置文件)在这里:https://huggingface.co/collections/DavidAU/d-au-source-files-for-gguf-exl2-awq-gptq-hqq-etc-etc-66b55cb8ba25f914cbf210be 其他选项: - 将重复惩罚增加到1.1到1.15(如果你使用了“smoothing_factor”,则无需这样做) - 如果你用来运行AI模型的界面/程序支持“二次采样”(“平滑”),只需按上述说明进行调整即可。 最高质量设置 / 最佳操作指南 / 参数和采样器 这是一个“Class 1”模型:有关此模型使用的所有设置(包括其“类别”的特定设置),包括生成示例和高级设置指南(通常可以解决任何模型问题),以及改善模型在所有用例(包括聊天、角色扮演和其他用例)中性能的方法,请参阅: https://huggingface.co/DavidAU/Maximizing-Model-Performance-All-Quants-Types-And-Full-Precision-by-Samplers_Parameters 你可以在此处查看生成所使用的所有参数,以及高级参数和采样器,以充分利用本模型: https://huggingface.co/DavidAU/Maximizing-Model-Performance-All-Quants-Types-And-Full-Precision-by-Samplers_Parameters — ## https://huggingface.co/DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF#qwen36-27b Qwen3.6-27B Qwen Chat (https://chat.qwen.ai/) > 本仓库包含了 Hugging Face Transformers 格式的后训练模型权重和配置文件。这些构件与 Hugging Face Transformers、vLLM、SGLang、KTransformers 等兼容。在二月份发布 Qwen3.5 系列之后,我们很高兴分享 Qwen3.6 的第一个开放权重变体。基于社区的反馈,Qwen3.6 优先考虑稳定性和实际效用,为开发者提供更直观、响应更快且真正高效的编码体验。 ## https://huggingface.co/DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF#qwen36-highlights Qwen3.6 亮点 本次发布带来了实质性的升级,尤其是在 - 代理式编码: 模型现在更流畅、更精确地处理前端工作流和仓库级别的推理。 - 思考保留: 我们引入了一个新选项,可以保留历史消息中的推理上下文,从而简化迭代开发并减少开销。 基准测试结果 (https://qianwen-res.oss-cn-beijing.aliyuncs.com/Qwen3.6/Figures/qwen3.6_27b_score.png) 更多详细信息,请参阅我们的博文 Qwen3.6-27B (https://qwen.ai/blog?id=qwen3.6-27b)。 ## https://huggingface.co/DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF#model-overview 模型概览 - 类型:带视觉编码器的因果语言模型 - 训练阶段:预训练 & 后训练 - 语言模型 - 参数数量:27B - 隐藏维度:5120 - 令牌嵌入:248320(填充后) - 层数:64 - 隐藏布局:16 × (3 × (门控DeltaNet → FFN) → 1 × (门控注意力 → FFN)) - 门控DeltaNet: - 线性注意力头数量:48个用于V,16个用于QK - 头维度:128 - 门控注意力: - 注意力头数量:24个用于Q,4个用于KV - 头维度:256 - 旋转位置嵌入维度:64 - 前馈网络: - 中间维度:17408 - LM输出:248320(填充后) - MTP:经过多步训练 - 上下文长度:原生262,144,可扩展至1,010,000个令牌。 ## https://huggingface.co/DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF#benchmark-results 基准测试结果 ### 语言 | 指标 | Qwen3.5-27B | Qwen3.5-397B-A17B | Gemma4-31B | Claude 4.5 Opus | Qwen3.6-35B-A3B | Qwen3.6-27B | |—|—|—|—|—|—|—| | 编码代理 | | | | | | | | SWE-bench Verified | 75.0 | 76.2 | 52.0 | 80.9 | 73.4 | 77.2 | | SWE-bench Pro | 51.2 | 50.9 | 35.7 | 57.1 | 49.5 | 53.5 | | SWE-bench Multilingual | 69.3 | 69.3 | 51.7 | 77.5 | 67.2 | 71.3 | | Terminal-Bench 2.0 | 41.6 | 52.5 | 42.9 | 59.3 | 51.5 | 59.3 | | SkillsBench | | | | | | | | Avg | 527.2 | 30.0 | 23.6 | 45.3 | 28.7 | 48.2 | | QwenWebBench | 1068 | 1186 | 1197 | 1536 | 1397 | 1487 | | NL2Repo | 27.3 | 32.2 | 15.5 | 43.2 | 29.4 | 36.2 | | Claw-Eval | | | | | | | | Avg | 64.3 | 70.7 | 48.5 | 76.6 | 68.7 | 72.4 | | Claw-Eval Pass^3 | 46.2 | 48.1 | 25.0 | 59.6 | 50.0 | 60.6 | | QwenClawBench | 52.2 | 51.8 | 41.7 | 52.3 | 52.6 | 53.4 | | 知识 | | | | | | | | MMLU-Pro | 86.1 | 87.8 | 85.2 | 89.5 | 85.2 | 86.2 | | MMLU-Redux | 93.2 | 94.9 | 93.7 | 95.6 | 93.3 | 93.5 | | SuperGPQA | 65.6 | 70.4 | 65.7 | 70.6 | 64.7 | 66.0 | | C-Eval | 90.5 | 93.0 | 82.6 | 92.2 | 90.0 | 91.4 | | STEM 与推理 | | | | | | | | GPQA Diamond | 85.5 | 88.4 | 84.3 | 87.0 | 86.0 | 87.8 | | HLE | 24.3 | 28.7 | 19.5 | 30.8 | 21.4 | 24.0 | | LiveCodeBench v6 | 80.7 | 83.6 | 80.0 | 84.8 | 80.4 | 83.9 | | HMMT Feb 25 | 92.0 | 94.8 | 88.7 | 92.9 | 90.7 | 93.8 | | HMMT Nov 25 | 89.8 | 92.7 | 87.5 | 93.3 | 89.1 | 90.7 | | HMMT Feb 26 | 84.3 | 87.9 | 77.2 | 85.3 | 83.6 | 84.3 | | IMOAnswerBench | 79.9 | 80.9 | 74.5 | 84.0 | 78.9 | 80.8 | | AIME26 | 92.6 | 93.3 | 89.2 | 95.1 | 92.7 | 94.1 | * SWE-Bench系列:内部代理脚手架(bash + 文件编辑工具);温度=1.0,top_p=0.95,200K上下文窗口。我们纠正了SWE-bench Pro公开集中一些有问题的任务,并在改进后的基准上评估所有基线。 * Terminal-Bench 2.0:Harbor/Terminus-2框架;3小时超时,32 CPU/48 GB RAM;温度=1.0,top_p=0.9
相似文章
DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
基于 Qwen 3.6 27B 模型的社区微调去审查版本,提供高精度 GGUF 量化。
DavidAU/Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF
DavidAU 发布了一款基于 Qwen 3.6 的自定义 40B 参数模型,该模型经过扩展并使用 Claude 4.6 Opus 蒸馏和 Deckard 数据集进行微调,具有优化的 GGUF 量化,以提升精度和无审查能力。
DavidAU/Qwen3.5-9B-Claude-4.6-HighIQ-THINKING-HERETIC-UNCENSORED
DavidAU发布了Qwen 3.5 9B的微调版本,命名为Qwen3.5-9B-Claude-4.6-HighIQ-THINKING-HERETIC-UNCENSORED,利用Claude 4.6的蒸馏数据来改进推理能力并移除审查。基准测试显示相比基础模型有所改进,拒绝率降低。
Qwen3.6-35B-A3B-Uncensored-Genesis-APEX-MTP
Qwen模型(Qwen3.6-35B-A3B)的精调无审查版本,支持MTP和APEX量化,经测试在200k上下文下稳定运行,推荐在LM Studio中使用。
Qwen/Qwen3.6-35B-A3B-FP8
阿里巴巴发布了Qwen3.6-35B-A3B-FP8,这是Qwen3.6的开源权重量化变体,拥有35B参数,通过MoE激活3B,具有改进的智能编码能力和保持思维链的迭代开发特性。