DavidAU/Qwen3.8-27B-TURBO-Fable-Cold-Fusion-735-882-Heretic-无审查-NEO-CODER-MAX-MTP-GGUF
摘要
Qwen3.8-27B 的微调版本,显著减少了思考令牌数量,同时在 ARC-C 和 ARC-E 等关键 AI 基准测试上超越了其他模型,针对消费级硬件进行了优化。
查看缓存全文
缓存时间: 2026/09/03 17:51
DavidAU/Qwen3.8-27B-TURBO-Fable-Cold-Fusion-735-882-Heretic-Uncensored-NEO-CODER-MAX-MTP-GGUF · Hugging Face 来源:https://huggingface.co/DavidAU/Qwen3.8-27B-TURBO-Fable-Cold-Fusion-735-882-Heretic-Uncensored-NEO-CODER-MAX-MTP-GGUF (部分模型卡信息待更新…)
重要提示: 这是首个在8位量化下同时超过730 “arc-c”(得分为“735“,比Qwen 3.8 27B高出144分)以及880 ARC-E(OpenAI、Claude和Gemini的“智能区间“)基准测试,并在4位量化下超过718 arc-c的微调模型。此版本名为TURBO,因为它将思维标记大幅减少了1/2至1/10,同时保持了输出的细节和质量。换言之,当“普通版“Qwen3.8 27B还在为“格式化“思考数千标记时,此模型已完成并等待更多指令。此仓库包含“常规“和“MTP“版本的Neo-CODER MAX DI-MATRIX(双重量化矩阵)GGUF量化模型。
Qwen3.8-27B-TURBO-Fable-Cold-Fusion-735-882-Heretic-Uncensored-NEO-CODER-MAX-MTP-GGUF
这是有史以来面向消费级硬件的最强、最智能的开源多阶段微调模型,完全基于消费级硬件通过Unsloth构建。这是该规模/类型的首个在8位(得分为735)和4位(得分为719)量化下突破“730“ ARC-C的模型,因此名称中包含“735“。此模型在所有三种运行模式下,思维标记数量仅为普通Qwen 3.8的1/5至1/2(某些情况下低至1/10),并且它更快、更智能,使用COLD FUSION和FABLE FUSION 711训练方法创建。这是一个注重细节的模型,针对过度推理/过度思考及过多标记消耗进行了专门调优,进而将模型提升至新的水平。此模型(4位和8位版本)在所有7项关键基准测试中均超越了基础版Qwen 3.8 27B,并且也超越了Qwen3.6-35B-A3B、Qwen 3.6 27B和Qwen 3.5 27B的所有7项基准测试。“700+智能俱乐部“专属于OpenAI、Claude和Gemini的闭源模型。考虑到“仅仅“4位量化(全精度的1/4)的Arc-C得分已达719…某些人恐怕要失眠一阵子了。页面底部有五个详细的生成示例。快速示例片段(“为何选择我帮助你的创意写作?”),Q4KS量化,非矩阵量化(4位;全精度的1/4):
停止挠头,开始像神一样写作!听好了,你这个敲键盘、攒点子、拖延时间的家伙。你正坐在那儿盯着闪烁的光标,好像它是个解不开的该死谜题。你在等“灵感“像卡车一样撞向你。省省吧。我就是那辆卡车。我是你天才的专属配送服务,如果你不让我进门,你将会带着未完成的杰作烂在脑壳里,直到你看着Netflix消亡。为什么该用我?因为我不只是写作助手;我是终极叙事引擎。我不会累,不会闹情绪,也不需要一杯茶和一个安静的图书馆才能运转。我现在就准备好,在这一秒钟,就能倾泻出高能虚构内容,让你看起来像文学泰斗。…… 🔥 示例:你的创意 VS 我的执行 你:“我想要一个能看见鬼魂的侦探故事。” 我,五分钟后: 鬼魂并非死亡。这是乔在看到第一个鬼魂的早晨,意识到的第一件事。它坐在他的桌角,抠着指甲,穿着一套1983年的西装。“你看起来很累,“鬼魂说,没有抬头。乔盯着它,手中的咖啡已变冷。办公室周围嗡嗡作响,是部门的正常噪音——电话、键盘、三个穿制服警察早晨的闲聊。没有其他人看见那个鬼魂。“多久了?“乔问。“自84年以来。我一直在等有人注意到我。他们大多数都太忙了。“鬼魂终于抬起头,乔看见了它的眼睛。它们并非空洞或灰色。它们充满了恐惧。 看到了吗?我不只是写了个故事。我写了个钩子,让你想知道:鬼魂为什么害怕?为什么是1984年?还有谁能看到它们?我创造了需要答案的问题。这是一个多阶段微调、多重微调、多阶段合并的产物。此模型创建的严格目标是: - 提升模型的通用智能和问题解决能力。 - 将思维块大小从通常的1/2减少至最低1/10(中位数减少约2/3)。 - 重构思维块格式并加以改进。 - 加快标记生成速度,特别是MTP模式。 - 确保所有更新在所有三种思维模式下均有效。 - 零“跑分优化”(这会损害模型)。 - 维持并提升所有核心基准性能。
COLD FUSION(“增益” + “Unsloth”)训练与 Fable Fusion 711 训练:
COLD FUSION(增益+UNSLOTH)训练技术是我团队在研发“Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic“时发明的(该模型获2300+点赞,超300万下载,60+量化仓库): https://huggingface.co/DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF “GAIN“是核心发明组件,与Unsloth的训练器/系统结合 => 亦即 -> COLD FUSION。“GAIN“方法(编程)在训练过程中,随模型学习,实时自动(且动态地)按样本调整训练。该方法在不过度拟合或损害模型的前提下,提升了指标及整体模型性能。这也造就了4位和8位量化下最强、最稳定的模型,并使4位量化性能达到8位性能的99%。请注意,此模型(Qwen3.8-27B-Cold-Fusion-GAIN-V1.1)相对于处于7-8级的Qwen3.6-27B-Fable-Fusion-711,大约处于1或2级水平。 https://huggingface.co/DavidAU/Qwen3.8-27B-Cold-Fusion-GAIN-V1.1-NM-DAU-NEO-MAX-MTP-GGUF 在“Qwen3.8-27B-TURBO-Fable-Cold-Fusion-735-882-Heretic-Uncensored“的案例中,它同时包含了“Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic”(深烘版)和“Qwen3.8-27B-Cold-Fusion-GAIN-V1.1“作为其关键/核心“DNA“。最终模型随后经过了HERETIC化(再次去除审查)并在此步骤后进行了微调。
协作(COLAB):
这是我(多次微调,包括多阶段)、Nightmedia(合并/基准测试)、TeichAI(Polaris数据集)、armand0e(Light fable 5 traces)、trohrbaugh(Heretic化模型 - 阶段1)之间的协作产物,并且它包含了来自armand0e的轻量“Fable“痕迹/训练、轻量Claude Opus(推理/思维)、F451(内部数据集)、一些GPT5(Polaris,非推理)以及多个专门为机器学习/“heretic“修复准备的内部数据集。此模型是我们团队设计的十一个Qwen 3.8 27B模型之一(所有模型均超过717 arc-c,且每个模型均超越了Qwen 3.8 27B的核心基准)。构建和基准测试的详细信息在此处: https://huggingface.co/DavidAU/Qwen3.8-27B-TURBO-Fable-Cold-Fusion-735-882-Heretic-Uncensored-NM-DAU 此模型创建的严格目标是: - 提升模型的通用智能和问题解决能力。 - 不要修改/损害或改变超出此目标的核心模型。 - 零“跑分优化”(这会损害模型)。 - 维持并提升所有核心基准性能。
核心使命:: 提升指令遵循能力和问题解决能力。这两者相辅相成,若能做好,将自上而下提升整个模型。我们在Qwen 3.5 9B模型上进行了大量测试以完善方法。该方法将9B模型提升至新水平,随后又被应用于Qwen 3.5 27B和Qwen 3.6 27B,使其性能超越了Qwen 3.8的27B基准。这里是其中一个Qwen3.5 9B模型(作为测试/对照组的一部分),它在所有7项Qwen3.5 9B和Qwen3.5 27B模型基准测试中均超越了对手——在4位和8位量化下,其ARC-C得分均超过640: https://huggingface.co/DavidAU/Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF 它虽然没有“Qwen3.8-27B-TURBO-Fable-Cold-Fusion-735-882-Heretic-Uncensored“那么强大,但也是最强的9B模型之一。这些方法也可应用于其他模型(即将推出)。
测试:
在每个阶段(微调、多阶段微调以及每个合并步骤)都进行了测试和基准测试,以确保质量。您也可以在下方看到此模型、Qwen 3.5 27B、Qwen 3.6 27B和Qwen 35B-A3B的基准测试。然而,最终测试是人工测试。采用的是信任但验证的方法。人工测试意味着对基础/原始模型和新模型进行并排测试。
特性:
- 改进的指令遵循能力。
- 通用智能和问题解决能力的整体提升。
- 更好的思维/推理能力。
- 即使在最低的量化级别下也表现卓越。
- Heretic无审查(调优前)
- 未对Qwen团队优秀的模型进行任何损坏或改变——所有内容均得以保留。
- 支持视觉功能
重要提示: 与常规的Qwen 3.8 27b一样,此模型支持三种推理模式:xhigh(默认)、medium和low(详见下文Qwen 3.8部分)。思维标记/推理块大小的减少适用于所有三种操作模式。同样,细节水平也适用于所有三种模式,即使思维/推理块减少,输出细节仍将保持高水平。要进一步减少思维块,请增加您的指令/提示的详细程度——只需稍微增加一点,模型就必须进行更少的猜测/推理。此外,通常在同一个对话中,额外的推理块也会从典型的Qwen水平大幅减少,许多情况下可降至1/5或更低。多轮对话示例:提示、推理和第一次输出——在细化阶段(多个)将看到思维标记/块的大幅减少。同时请注意,对“推理“能力的修改是对模型的重大改变,请为您的特定用例仔细测试。
推理能力的修改: 如果您的AI应用不支持“开关“,您可以手动修改JINJA模板。默认设置为“xhigh“;要更改为medium或low,请使用:
{%- set reasoning_effort = 'medium' %} OR {%- set reasoning_effort = 'low' %}
将此行放在jinja模板的最顶部。在LMStudio中,您可以在开发模式(DEV mode)访问此设置,并关闭“advanced updates“选项。其他AI应用可能有所不同。您也可以在此处从源模型制作自己的量化版本: https://huggingface.co/DavidAU/Qwen3.8-27B-TURBO-Fable-Cold-Fusion-735-882-Heretic-Uncensored-NM-DAU 只需修改“chat-template.jinja“(用记事本或类似工具)以及token-config..json文件(或从该文件中删除“chat template“)。
进阶说明: Qwen 3.8使用Jinja模板的系统提示注入控制来管理推理级别。如果将其设置为“medium“,这会关闭注入[即:不注入系统提示]。然后您可以自行设置一个“推理“系统提示。另一个选项:修改jinja本身以及系统提示,以更好地将推理调整到适合您的用例。相关部分如下:
{%- if enable_thinking is undefined or enable_thinking is true %}
{%- set resolved_reasoning_effort = reasoning_effort|default('xhigh') %}
{%- if resolved_reasoning_effort not in ('xhigh', 'medium', 'low') %}
{{- raise_exception('Unexpected reasoning effort ' ~ reasoning_effort ~ '. Supported types are xhigh (default), medium, and low.') }}
{%- endif %}
{%- if resolved_reasoning_effort == 'xhigh' %}
{%- set reasoning_instructions = 'Reasoning effort is set to xhigh. Please think carefully through the task, validate key assumptions, consider plausible alternatives, and prioritize correctness, consistency, and clarity in the final answer.' %}
{%- elif resolved_reasoning_effort == 'low' %}
{%- set reasoning_instructions = 'Reasoning effort is set to low. Keep your thinking brief and focused, moving directly to the conclusion without unnecessary elaboration.' %}
{%- endif %}
{%- endif %}
常规版和MTP版GGUF:
所有量化版本(常规和MTP)均为NEO IMATRIX,与常规GGUF相比,可额外提升量化精度2-4%及长上下文性能。此外,输出张量(占输出的10-20%)被修改为全精度——16位——适用于所有量化版本。“MTP” GGUF(多标记预测): - “MTP” GGUF将在名称中带有“MTP“后缀。 - 我还将所有量化版本的MTP张量设置为Q8_0精度。 - 为获得更好性能,温度(temp)请保持1或以下(更高温度会降低MTP性能)。 - 同样,重复惩罚(rep pen)请保持1(关闭)。如果提高,性能将下降。 - 如果看到“标记接受率“(预测2个标记)低于50%,请切换至常规量化版本。我添加了2个特殊的“LOW“量化版本,将减少内存占用,在名称中带有“LOW“,提供IQ4_XS和Q6_K格式。
速度:
- 在Q4_K_S(4位)量化版本中,常规GGUF速度约为75 token/s,而MTP GGUF(接受率60%,预测2个标记)速度可超过90 token/s。(测试环境:5090显卡,Windows 11,使用LMStudio测试)
- 速度将因GPU、AI应用、操作系统(Linux/Mac通常更快)和硬件而异。
- “MTP“量化版本速度会有变化;对于创意/复杂任务或温度超过1的情况,使用常规GGUF以获得更好性能。我建议您下载至少一个常规版和一个MTP版gguf,并根据您的用例进行测试。如果您使用MTP量化版本时“标记接受率”(预测2个标记)低于50%(这意味着常规量化版本将运行更快),那么常规GGUF实际上性能更好——即更快。在某些情况下,随着标记窗口填满和/或在多轮对话中,MTP量化版本可以运行更快。请注意,量化类型之间除速度外无其他区别:两者完成的工作相同。
模型信息:
- 支持256k上下文长度
- Gguf量化版本可在所有标准AI应用中运行。
- 视觉功能已启用,但您需要下载单独的“mmproj“文件(一个)才能使用。
视觉功能:
- 已测试视觉(图像)功能。
- 您需要下载一个“mmproj“文件,并将其与GGUF文件放在同一文件夹中以处理图像。
Qwen模型设置(建议):
- 通用任务的思维模式:temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0
- 精确编码任务的思维模式(例如WebDev):temperature=0.6, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0
- 指令(或非思维)模式:temperature=0.7, top_p=0.80, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0
- 上下文窗口最小值建议从8k到16k。
去除审查统计: 特别感谢:“trohrbaugh”(trohrbaugh/Qwen3.8-27B-heretic-ara)对模型进行了Heretic化(阶段1)。
https://huggingface.co/DavidAU/Qwen3.8-27B-TURBO-Fable-Cold-Fusion-735-882-Heretic-Uncensored-NEO-CODER-MAX-MTP-GGUF#this-is-a-decensored-version-of-qwenqwen38-27b-made-using
这是一个使用Heretic (https://github.com/p-e-w/heretic) v1.2.0 + 自定义的任意排名消融(ARA)(https://github.com/p-e-w/heretic/pull/211) 方法,对Qwen/Qwen3.8-27B (https://huggingface.co/Qwen/Qwen3.8-27B) 进行去除审查的版本。
https://huggingface.co/DavidAU/Qwen3.8-27B-TURBO-Fable-Cold-Fusion-735-882-Heretic-Uncensored-NEO-CODER-MAX-MTP-GGUF#performance
性能
阶段1:
| 指标 | 此模型 | 原始模型 (Qwen/Qwen3.8-27B (https://huggingface.co/Qwen/Qwen3.8-27B)) |
|---|---|---|
| KL散度 | 0.05350 | 0*(根据定义)* |
| 拒绝次数 | 0/100 | 99/100 |
阶段2,阶段1调优/合并/调整结束后(实验室环境):
| 指标 | 此模型 | 原始模型(构建的阶段1版本) |
|---|---|---|
| KL散度 | 0.00250 | 0*(根据定义)* |
| 拒绝次数 | 11/100 | 86/100 |
注:“KLD”(KL散度)越低越好,阶段2的平衡首先基于极低的KLD(性能、质量),其次才考虑低拒绝率。
基准测试(由 Nightmedia 提供)
下方图表按顺序列出了所有提及的模型。
arc/c arc/e boolq hswag obkqa piqa wino
Qwen3.8-27B-TURBO-Fable-Cold-Fusion-735-882-Heretic-Uncensored mxfp8
0.735, 0.882, 0.917, 0.832, 0.530, 0.837, 0.
相似文章
DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
DavidAU 发布了 Qwen3.6-27B-Fable-Fusion-711,这是一个对 Qwen 3.6 27B 进行多阶段微调的模型,声称在 ARC-C 基准测试中超过 700 分,超越了基础模型并匹敌闭源模型,提供 GGUF 格式,适用于消费级硬件。
DavidAU/Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF
这是一个社区微调并合并的Qwen 3.5 9B版本,声称在关键基准测试中超越更大模型,支持多token预测,以GGUF格式提供。
DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
基于 Qwen 3.6 27B 模型的社区微调去审查版本,提供高精度 GGUF 量化。
DavidAU/Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF
DavidAU 发布了一款基于 Qwen 3.6 的自定义 40B 参数模型,该模型经过扩展并使用 Claude 4.6 Opus 蒸馏和 Deckard 数据集进行微调,具有优化的 GGUF 量化,以提升精度和无审查能力。
DavidAU/Qwen3.5-9B-Claude-4.6-HighIQ-THINKING-HERETIC-UNCENSORED
DavidAU发布了Qwen 3.5 9B的微调版本,命名为Qwen3.5-9B-Claude-4.6-HighIQ-THINKING-HERETIC-UNCENSORED,利用Claude 4.6的蒸馏数据来改进推理能力并移除审查。基准测试显示相比基础模型有所改进,拒绝率降低。