Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF

Hugging Face Models Trending 模型

摘要

Jackrong 发布了 Qwopus3.6-27B-Coder-Compat-MTP-GGUF,这是 Qwopus3.6-27B-Coder 模型的 GGUF 量化版本,并扩展了聊天模板,以提升与工具使用运行时及 OpenAI 兼容的代理框架的互操作性。

Task: image-text-to-text Tags: transformers, gguf, llama.cpp, image-text-to-text, vision, multimodal, text-generation-inference, unsloth, conversational, qwen3_6, reasoning, chain-of-thought, agent, tool-use, function-calling, coder, mtp, speculative-decoding, compatibility, en, zh, es, ru, ja, dataset:Jackrong/Claude-opus-4.6-TraceInversion-9000x, dataset:Jackrong/Claude-opus-4.7-TraceInversion-5000x, dataset:lambda/hermes-agent-reasoning-traces, base_model:Jackrong/Qwopus3.6-27B-Coder, base_model:quantized:Jackrong/Qwopus3.6-27B-Coder, license:apache-2.0, endpoints_compatible, region:us
查看原文
查看缓存全文

缓存时间: 2026/06/24 19:45

Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF · Hugging Face 来源:https://huggingface.co/Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF

🟢 Qwopus3.6-27B-Coder-Compat-MTP-GGUF 兼容版 Bundled-MTP GGUF 发布,扩展了聊天模板互操作性,适用于工具使用运行环境和 OpenAI 兼容的代理历史记录。

✓ JSON 字符串参数
✓ 映射与列表参数
✓ llama.cpp / minja
✓ Hugging Face Jinja
⚡ Bundled MTP
🧠 权重一致性验证

🌐 兼容性优先的模板更新

此版本扩大了与代理框架的互操作性,这些框架以不同有效表示形式存储历史 tool_call.function.arguments。嵌入的模板接受预序列化的 JSON 字符串以及结构化映射和列表,同时保留原始工具调用的负载。这是一个模板级别的兼容性更新:模型权重和捆绑的 MTP 预测张量保持不变。

HF 模板渲染:10 / 10 —— 所有兼容性案例成功渲染。
llama.cpp / minja:10 / 10 —— 精确命令和参数被保留。
循环回归:0 次循环 —— 10/10 案例,无格式错误的工具调用循环。
MTP 接受率:76.81% —— 在 1,229 个草稿令牌中接受了 944 个。

📊 权重一致的 Q4_K_M 模板比较

指标兼容模板官方模板
HF 渲染10/103/10
minja 渲染10/109/10
编码质量1.70 / 21.70 / 2
中位解码速度30.53 tok/s29.92 tok/s
MTP 接受率76.81%76.41%
速度集提示令牌数11,15012,238

验证使用两个 Q4_K_M GGUF 文件,在所有 866 个张量(包括捆绑的 MTP/NextN 张量)上具有相同的逐张量 SHA-256 清单。测试在 NVIDIA GB10 上运行,llama.cpp 构建 9733,32K 上下文,一个并行槽,启用 Jinja,禁用推理,启用 MTP 草稿解码。测量的速度差异为兼容模板 +2.06%,属于正常运行时波动范围。

兼容性范围: 此更新针对 Hugging Face Jinja、llama.cpp/minja 以及 OpenAI 兼容工具调用表示的聊天历史序列化和模板渲染。它不改变训练后的模型权重、编码专长、视觉能力或 MTP 架构。

🤝 模板更新由 Kyle Hessling 完成

此兼容模板修改由 Kyle Hessling 完成。感谢 Kyle 在支持的工具调用格式和运行环境中实现并验证了此更新。如果您遇到任何与模板相关的问题,请在 X 上关注并联系 Kyle 分享反馈:@KyleHessling1 (https://x.com/KyleHessling1)


https://huggingface.co/Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF#original-qwopus36-27b-coder-mtp-gguf-model-card 原始 Qwopus3.6-27B-Coder-MTP-GGUF 模型卡

下方保留了完整的原始模型卡,包括模型背景、训练细节、基准测试、使用指南、资源、致谢和引用。

🪐 Qwopus-3.6-27B-Coder Coder SFT 发布 代理编码与工具使用推理模型 基于 Qwopus3.6-27B-v2 微调

🧬 迹反转与负熵
🧠 27B 密集模型
⚡ 代理编码
🛠️ 工具调用与代理
🏆 SWE-bench Verified:67.0%(关闭推理)

💡 什么是 Qwopus-3.6-27B-Coder?

🪐 Qwopus-3.6-27B-Coder 是一款基于 Qwopus3.6-27B-v2 构建的推理增强型代理编码模型。它继承了 v2 基座的强大推理基础——该基座在 MMLU-Pro(300 题)上达到 87.43%,在 SWE-bench Verified 上达到 75.25%——并进一步专精于代理代码生成、结构化工具调用、调试以及开发者工作流中的指令遵循。该模型旨在擅长仓库级编码任务、多轮工具编排以及在真实代理环境下的复杂逻辑推理。

🧩 代理编码:针对仓库级编码、调试、补丁生成和结构化多步开发工作流进行了优化。
🛠️ 工具调用:从包含工具定义、工具调用和环境反馈的真实代理轨迹中学习,实现鲁棒的多轮执行。
🧬 迹反转:继承了完整的 Qwopus 训练配方,使用从 Claude Opus 重建的逐步推理轨迹。
🚀 27B 规模:密集 27B 参数,原生支持长上下文,在单 GPU 上即可部署,提供深度推理能力。

社区发布声明:Qwopus-3.6-27B-Coder 是一个实验性社区发布,旨在用于研究、评估和代理工作流探索。尚未经过全面的安全评估或广泛的通用领域基准测试。

基准测试状态:首个完成的基准测试是 SWE-bench Verified 全 500 题,在 不推理 / 无推理模式 下,Q5_K_M 27B GGUF 运行解决了 335/500 = 67.0%。其他基准测试套件仍在进行中,并在测试完成后更新。


https://huggingface.co/Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF#%F0%9F%92%A1-1-base-model-training-stack–collaboration 💡 1. 基座模型、训练栈与协作

🧠 1.1 基座模型:Qwopus3.6-27B-v2

Qwopus3.6-27B-v2 是一款基于 Qwen3.6-27B 构建的推理增强型密集语言模型。通过多阶段课程学习流水线和迹反转增强,它在知识、编码和推理基准测试上取得了强劲性能。此编码器变体继承了该基础,并扩展了专门的编码和工具使用数据。

属性规格与详情
🧠 架构密集 Transformer / 270 亿参数
🏢 基础开发者阿里云(DAMO Academy)— Qwen3.6-27B
🎯 主要焦点代理编码、工具使用稳定性、代码调试、结构化指令遵循、仓库级任务
🧬 蒸馏策略迹反转 + 高质量代理轨迹 + 课程 SFT
📄 上下文窗口原生支持最高 32K 令牌(微调目标);通过 RoPE/YaRN 缩放兼容更长上下文

🧪 1.2 硬件合作与联合协作

本工程与工程师 Kyle Hessling 紧密合作完成,其硬件基础设施和训练支持使稳定的 27B 规模微调和评估成为可能。

👉 您可以在 X / Twitter 上关注他以获取硬件和模型训练更新:@KyleHessling1 (https://x.com/KyleHessling1)

🦥 1.3 微调框架(Unsloth)

模型训练工作流借助 Unsloth 加速并优化内存使用。特别感谢 Unsloth 团队让高效的大模型微调变得触手可及。

1.4 MTP 变体:更快的推测解码

该模型也提供 多令牌预测(MTP) 变体,配备辅助预测头(draft=2)用于推测解码。基于 Qwopus3.6-27B-v2-MTP 基准测试,MTP 变体在保持准确率的同时,相比标准解码实现了 ~1.66 倍加速。详见 Qwopus3.6-27B-v2-MTP (https://huggingface.co/Jackrong/Qwopus3.6-27B-v2-MTP) 模型卡中关于 MTP 性能的详细分析。

🌟 自定义 MTP 头处理流水线已在 qwen-mtp-gguf (https://github.com/R6410418/Jackrong-llm-finetuning-guide/tree/main/qwen-mtp-gguf) 开源。如果您觉得此工具包有用,请考虑在 GitHub 上点星!


https://huggingface.co/Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF#%F0%9F%93%96-2-background–motivation 📖 2. 背景与动机

🎯 2.1 为什么是 27B 编码器模型?

Qwopus 编码器系列在 4B 和 9B 规模上已展现出强劲结果。27B 编码器变体代表了推理深度、代码生成质量和工具使用鲁棒性的重大飞跃。在 27B 参数下,模型有足够的能力内化复杂的仓库结构、多文件依赖关系以及细微的工具调用模式——同时仍可在单 GPU(例如 RTX 5090)上部署。该规模弥合了紧凑型本地模型与昂贵的基于 API 的解决方案之间的差距,使其适用于生产环境的代理编码工作流。

🧬 2.2 迹反转与代理行为

商业和前沿模型通常仅暴露压缩的推理摘要。Qwopus 风格的训练使用 迹反转 将这些压缩的“推理气泡”重建为更完整可学习的推理轨迹。对于编码而言,这与包含工具定义、工具调用和真实反馈的代理轨迹配对,教导模型通过交互工作而非仅生成静态答案来进行推理。

该模型整合了:

  • claude-opus-4.6-traceInversion-9000x:9,000 个高价值、完全重建的逐步推理轨迹。
  • claude-opus-4.7-traceInversion-5000x:5,000 个复杂多轮逻辑与数学样本,针对负熵重建优化。
  • lambda/hermes-agent-reasoning-traces:来自 GLM-5.1 和 kimi-4.6 模型的约 10,000 个高质量多轮工具调用轨迹。

📦 2.3 专用数据集:迹反转与代理轨迹

迹反转: 使用专门的逻辑重建器 Trace-Inverter-4B (https://huggingface.co/Jackrong/Trace-Inverter-4B),将压缩的推理气泡逆向工程为完整的、逐步的可学习 CoT 链。这种方法解决了 “信息熵陷阱”——即直接模仿压缩摘要会导致推理断裂——通过确保模型学习连续的、严谨的逻辑推导。

代理轨迹(lambda/hermes-agent-reasoning-traces): 每个样本包含真实的多轮工具执行结果(非捏造输出),并在 <think> 标签内包含逐步推理。覆盖范围包括:

  • 终端与编码: 脚本编写、调试、环境配置
  • 仓库任务: 修复错误、重构、代码审查
  • 浏览器自动化: 网页导航、数据抓取、填表
  • 代理工具: 内存持久化、任务委派、技能管理

https://huggingface.co/Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF#%F0%9F%93%8A-3-performance-benchmarks 📊 3. 性能基准测试

📊 评估与性能指标

首个完成的结果:SWE-bench Verified 全 500 题,在无推理模式下评估,用于快速本地代理编码。

无推理 SWE-bench 结果

该基准测试特意在 禁用推理 的情况下运行。目的是展示模型在作为快速本地代理使用时(不依赖冗长的可见推理轨迹)的实际编码能力。在配备 MTP 的 RTX 5090 上,模型运行速度约为 100 令牌/秒,使此结果对交互式开发工作流特别重要。

SWE-bench Verified67.0%335 / 500 已解决
推理模式关闭推理无需可见 CoT
本地吞吐量~100 t/sRTX 5090 + MTP
评估构建Q5_K_M27B GGUF 量化

评估设置: SWE-bench Verified 全 500 题,Qwopus-3.6-27B-Coder Q5_K_M GGUF,禁用推理 / 无推理模式。最终分数:335/500 = 67.0%

💻 3.1 SWE-bench Verified:全 500 题无推理结果

SWE-bench Verified 衡量模型是否能够通过编辑仓库代码并通过隐藏测试来解决真实的 GitHub 问题。在此次运行中,Qwopus-3.6-27B-Coder 在 无推理模式 下解决了 335/500 个验证任务,优先考虑直接行动质量和本地速度,而非冗长的显式推理。

指标结果备注
最终分数335/500 = 67.0%完整的 SWE-bench Verified 500 任务拆分
模式关闭推理评估期间无长链显式推理
量化Q5_K_M GGUF本地 27B 量化部署
吞吐量~100 令牌/秒在配备 MTP 的 RTX 5090 上观察到

🧩 3.2 仓库级分解

结果在实用库维护任务(如 scikit-learn、xarray、requests 和 Django)上最强,同时在符号数学、测试基础设施、文档工具和绘图库上也有不错的表现。

仓库解决率
scikit-learn27/32 = 84%
pydata/xarray18/22 = 82%
psf/requests6/8 = 75%
django166/231 = 72%
sympy48/75 = 64%
pytest12/19 = 63%
sphinx-doc26/44 = 59%
matplotlib20/34 = 59%
astropy9/22 = 41%
pylint2/10 = 20%

⚖️ 3.3 SWE-bench Verified 参考对比

重要对比说明: 下方参考分数来自外部模型报告,通常为 启用推理 或特定 harness 下的结果(已注明)。Qwopus-3.6-27B-Coder 在此处展示为 无推理、量化的本地运行,因此该表应作为定位参考,而非严格的同模式排行榜。

模型推理模式SWE-bench Verified备注
Qwopus-3.6-27B-Coder关闭 / 无推理67.0Q5_K_M, RTX 5090 + MTP, ~100 t/s
OpenAI GPT-5启用70.1启用推理参考
OpenAI GPT-5 mini启用59.8启用推理参考
OpenAI GPT-5 nano启用34.8启用推理参考
GLM-4.7启用70.6OpenHands 参考
GLM-4.5-Air启用57.6OpenHands 参考
Qwen3-Coder-30B-A3B-Instruct (2025-07)关闭 / 无推理70.3无推理参考
Claude 4.0 Opus启用67.6启用推理参考
Claude 4.5 Opus启用80.9启用推理参考
Qwen3.6-27B启用77.2启用推理参考
Qwen3.5-397B-A17B启用76.2启用推理参考
Qwen3.5-27B启用75.0启用推理参考
Qwen3.6-35B-A3B启用73.4启用推理参考
Gemma4-31B启用52.0启用推理参考
Gemma4-26B-A4B启用17.4启用推理参考

🎮 3.4 实时无推理演示:Boat Survival

Kyle Hessling 还在一个小型交互式游戏环境中测试了禁用推理的 Qwopus-3.6-27B-Coder。该演示是一个实用的冒烟测试,评估快速决策、指令遵循和本地响应能力,超越静态基准表。

Boat Survival 禁用推理 Qwopus-3.6-27B-Coder 演示截图

结论: 重点不在于此无推理本地运行击败了每个启用推理的前沿参考。重要的是,一个量化的 27B 本地编码器可以在完整的 SWE-bench Verified 拆分上达到 67.0%,同时保持足够的速度以支持交互式代理循环。这使得 Qwopus-3.6-27B-Coder 成为开发者一个实用的选择,能够在不需要长推理模式延迟的情况下获得强大的仓库级修复性能。


https://huggingface.co/Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF#%F0%9F%97%BA%EF%B8%8F-4-training–data-pipeline-overview 🗺️ 4. 训练与数据流水线概述

训练过程融合了 迹反转 数据增强与 三阶段课程学习 流水线。核心工程侧重于逐步扩展上下文长度,同时在重建的推理轨迹和真实代理轨迹上进行训练,以保持输出格式稳定。

[ 🗺️ 迹反转:重建蒸馏工作流 ]

A. 代理模型训练(迹反转器)

开源模型(GLM-5.1 / DS-V4)──► 完整推理链 ──► [ Qwen3-235B 压缩 ] ──► 推理气泡
│                                        │
└──────────────────► [ 训练 ] ◄──────────┘
(基础:Qwen3-4B-Instruct)
(结果:Trace-Inverter-4B)

B. 反转阶段:重建 Claude-4.7-Max

_______________________________________________________
|                                                     |
|  Claude-4.7-Max API ──► 压缩气泡 + 答案             |
|_____________________________________________________|
                              │
                              ▼
[ 🧠 Trace-Inverter-4B(逻辑重建器)] ──► 合成深度推理轨迹(可学习 CoT)
                              │
                              ▼
[ 🧩 数据拼接 ] ◄──────────(原始提示 + 响应)
(将重建的 CoT 嵌入 <think> 标签,与原始提示/响应拼接)
                              │
                              ▼
(结果:claude-opus-4.6/4.7 反转集)

C. 最终编码器 SFT 课程流水线

___________________________________________
|                                         |
|  基座模型(Qwopus3.6-27B-v2)           |
|_________________________________________|
              │
              ▼
[ 📦 阶段 1:格式起步 ] ──► [ 🛠️ 阶段 2:代理/编码扩展 ] ──► [ 🚀 阶段 3:长上下文 SFT ]
( < 4096 令牌 )           ( 4096 - 8192 令牌 )              ( 8192 - 32K 令牌 )
(稳定格式)                 (工具轨迹 + 编码任务)              (长/多轮上下文)

相似文章

Jackrong/Qwopus3.6-27B-Coder-MTP-GGUF

Hugging Face Models Trending

GGUF量化版本的Qwopus3.6-27B-Coder-MTP模型已发布在Hugging Face上,针对本地推理进行了优化,兼容Transformers、vLLM、SGLang和Unsloth Studio。

Jackrong/Qwopus3.6-27B-v2-MTP-GGUF

Hugging Face Models Trending

Jackrong/Qwopus3.6-27B-v2-MTP-GGUF 是 27B 参数语言模型的 GGUF 量化版本,托管在 Hugging Face 上,并附有使用各种库和工具的说明。

Jackrong/Qwopus3.6-35B-A3B-Coder-MTP-GGUF

Hugging Face Models Trending

在 Hugging Face 上发布,Qwopus-3.6-35B-A3B-Coder 是一个经过微调的混合专家(MoE)编码代理模型,专为高效、低延迟的本地执行而设计,可在代理工作流中减少 token 浪费。

Jackrong/Qwopus3.5-9B-Coder-MTP-GGUF

Hugging Face Models Trending

Jackrong 发布了 Qwopus3.5-9B-Coder-MTP-GGUF,这是一个基于 Qwen 的 9B 代码模型,采用多令牌预测 (MTP) 架构进行微调,相较于基模型实现了 35.8% 的吞吐量提升和 8.3% 的准确率提升,在代码和数学基准测试中取得满分。

Jackrong/Qwopus3.6-35B-A3B-v1-GGUF

Hugging Face Models Trending

Jackrong 发布 Qwopus3.6-35B-A3B-v1,基于阿里巴巴 Qwen3.6 MoE 模型的推理增强微调版本,针对逻辑推理和智能体编程优化,拥有 350 亿总参数和 30 亿激活参数。