Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF
摘要
Jackrong 发布了 Qwopus3.6-27B-Coder-Compat-MTP-GGUF,这是 Qwopus3.6-27B-Coder 模型的 GGUF 量化版本,并扩展了聊天模板,以提升与工具使用运行时及 OpenAI 兼容的代理框架的互操作性。
查看缓存全文
缓存时间: 2026/06/24 19:45
Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF · Hugging Face 来源:https://huggingface.co/Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF
🟢 Qwopus3.6-27B-Coder-Compat-MTP-GGUF 兼容版 Bundled-MTP GGUF 发布,扩展了聊天模板互操作性,适用于工具使用运行环境和 OpenAI 兼容的代理历史记录。
✓ JSON 字符串参数
✓ 映射与列表参数
✓ llama.cpp / minja
✓ Hugging Face Jinja
⚡ Bundled MTP
🧠 权重一致性验证
🌐 兼容性优先的模板更新
此版本扩大了与代理框架的互操作性,这些框架以不同有效表示形式存储历史 tool_call.function.arguments。嵌入的模板接受预序列化的 JSON 字符串以及结构化映射和列表,同时保留原始工具调用的负载。这是一个模板级别的兼容性更新:模型权重和捆绑的 MTP 预测张量保持不变。
HF 模板渲染:10 / 10 —— 所有兼容性案例成功渲染。
llama.cpp / minja:10 / 10 —— 精确命令和参数被保留。
循环回归:0 次循环 —— 10/10 案例,无格式错误的工具调用循环。
MTP 接受率:76.81% —— 在 1,229 个草稿令牌中接受了 944 个。
📊 权重一致的 Q4_K_M 模板比较
| 指标 | 兼容模板 | 官方模板 |
|---|---|---|
| HF 渲染 | 10/10 | 3/10 |
| minja 渲染 | 10/10 | 9/10 |
| 编码质量 | 1.70 / 2 | 1.70 / 2 |
| 中位解码速度 | 30.53 tok/s | 29.92 tok/s |
| MTP 接受率 | 76.81% | 76.41% |
| 速度集提示令牌数 | 11,150 | 12,238 |
验证使用两个 Q4_K_M GGUF 文件,在所有 866 个张量(包括捆绑的 MTP/NextN 张量)上具有相同的逐张量 SHA-256 清单。测试在 NVIDIA GB10 上运行,llama.cpp 构建 9733,32K 上下文,一个并行槽,启用 Jinja,禁用推理,启用 MTP 草稿解码。测量的速度差异为兼容模板 +2.06%,属于正常运行时波动范围。
兼容性范围: 此更新针对 Hugging Face Jinja、llama.cpp/minja 以及 OpenAI 兼容工具调用表示的聊天历史序列化和模板渲染。它不改变训练后的模型权重、编码专长、视觉能力或 MTP 架构。
🤝 模板更新由 Kyle Hessling 完成
此兼容模板修改由 Kyle Hessling 完成。感谢 Kyle 在支持的工具调用格式和运行环境中实现并验证了此更新。如果您遇到任何与模板相关的问题,请在 X 上关注并联系 Kyle 分享反馈:@KyleHessling1 (https://x.com/KyleHessling1)
https://huggingface.co/Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF#original-qwopus36-27b-coder-mtp-gguf-model-card 原始 Qwopus3.6-27B-Coder-MTP-GGUF 模型卡
下方保留了完整的原始模型卡,包括模型背景、训练细节、基准测试、使用指南、资源、致谢和引用。
🪐 Qwopus-3.6-27B-Coder Coder SFT 发布 代理编码与工具使用推理模型 基于 Qwopus3.6-27B-v2 微调
🧬 迹反转与负熵
🧠 27B 密集模型
⚡ 代理编码
🛠️ 工具调用与代理
🏆 SWE-bench Verified:67.0%(关闭推理)
💡 什么是 Qwopus-3.6-27B-Coder?
🪐 Qwopus-3.6-27B-Coder 是一款基于 Qwopus3.6-27B-v2 构建的推理增强型代理编码模型。它继承了 v2 基座的强大推理基础——该基座在 MMLU-Pro(300 题)上达到 87.43%,在 SWE-bench Verified 上达到 75.25%——并进一步专精于代理代码生成、结构化工具调用、调试以及开发者工作流中的指令遵循。该模型旨在擅长仓库级编码任务、多轮工具编排以及在真实代理环境下的复杂逻辑推理。
🧩 代理编码:针对仓库级编码、调试、补丁生成和结构化多步开发工作流进行了优化。
🛠️ 工具调用:从包含工具定义、工具调用和环境反馈的真实代理轨迹中学习,实现鲁棒的多轮执行。
🧬 迹反转:继承了完整的 Qwopus 训练配方,使用从 Claude Opus 重建的逐步推理轨迹。
🚀 27B 规模:密集 27B 参数,原生支持长上下文,在单 GPU 上即可部署,提供深度推理能力。
社区发布声明:Qwopus-3.6-27B-Coder 是一个实验性社区发布,旨在用于研究、评估和代理工作流探索。尚未经过全面的安全评估或广泛的通用领域基准测试。
基准测试状态:首个完成的基准测试是 SWE-bench Verified 全 500 题,在 不推理 / 无推理模式 下,Q5_K_M 27B GGUF 运行解决了 335/500 = 67.0%。其他基准测试套件仍在进行中,并在测试完成后更新。
https://huggingface.co/Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF#%F0%9F%92%A1-1-base-model-training-stack–collaboration 💡 1. 基座模型、训练栈与协作
🧠 1.1 基座模型:Qwopus3.6-27B-v2
Qwopus3.6-27B-v2 是一款基于 Qwen3.6-27B 构建的推理增强型密集语言模型。通过多阶段课程学习流水线和迹反转增强,它在知识、编码和推理基准测试上取得了强劲性能。此编码器变体继承了该基础,并扩展了专门的编码和工具使用数据。
| 属性 | 规格与详情 |
|---|---|
| 🧠 架构 | 密集 Transformer / 270 亿参数 |
| 🏢 基础开发者 | 阿里云(DAMO Academy)— Qwen3.6-27B |
| 🎯 主要焦点 | 代理编码、工具使用稳定性、代码调试、结构化指令遵循、仓库级任务 |
| 🧬 蒸馏策略 | 迹反转 + 高质量代理轨迹 + 课程 SFT |
| 📄 上下文窗口 | 原生支持最高 32K 令牌(微调目标);通过 RoPE/YaRN 缩放兼容更长上下文 |
🧪 1.2 硬件合作与联合协作
本工程与工程师 Kyle Hessling 紧密合作完成,其硬件基础设施和训练支持使稳定的 27B 规模微调和评估成为可能。
👉 您可以在 X / Twitter 上关注他以获取硬件和模型训练更新:@KyleHessling1 (https://x.com/KyleHessling1)
🦥 1.3 微调框架(Unsloth)
模型训练工作流借助 Unsloth 加速并优化内存使用。特别感谢 Unsloth 团队让高效的大模型微调变得触手可及。
⚡ 1.4 MTP 变体:更快的推测解码
该模型也提供 多令牌预测(MTP) 变体,配备辅助预测头(draft=2)用于推测解码。基于 Qwopus3.6-27B-v2-MTP 基准测试,MTP 变体在保持准确率的同时,相比标准解码实现了 ~1.66 倍加速。详见 Qwopus3.6-27B-v2-MTP (https://huggingface.co/Jackrong/Qwopus3.6-27B-v2-MTP) 模型卡中关于 MTP 性能的详细分析。
🌟 自定义 MTP 头处理流水线已在 qwen-mtp-gguf (https://github.com/R6410418/Jackrong-llm-finetuning-guide/tree/main/qwen-mtp-gguf) 开源。如果您觉得此工具包有用,请考虑在 GitHub 上点星!
https://huggingface.co/Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF#%F0%9F%93%96-2-background–motivation 📖 2. 背景与动机
🎯 2.1 为什么是 27B 编码器模型?
Qwopus 编码器系列在 4B 和 9B 规模上已展现出强劲结果。27B 编码器变体代表了推理深度、代码生成质量和工具使用鲁棒性的重大飞跃。在 27B 参数下,模型有足够的能力内化复杂的仓库结构、多文件依赖关系以及细微的工具调用模式——同时仍可在单 GPU(例如 RTX 5090)上部署。该规模弥合了紧凑型本地模型与昂贵的基于 API 的解决方案之间的差距,使其适用于生产环境的代理编码工作流。
🧬 2.2 迹反转与代理行为
商业和前沿模型通常仅暴露压缩的推理摘要。Qwopus 风格的训练使用 迹反转 将这些压缩的“推理气泡”重建为更完整可学习的推理轨迹。对于编码而言,这与包含工具定义、工具调用和真实反馈的代理轨迹配对,教导模型通过交互工作而非仅生成静态答案来进行推理。
该模型整合了:
- claude-opus-4.6-traceInversion-9000x:9,000 个高价值、完全重建的逐步推理轨迹。
- claude-opus-4.7-traceInversion-5000x:5,000 个复杂多轮逻辑与数学样本,针对负熵重建优化。
- lambda/hermes-agent-reasoning-traces:来自 GLM-5.1 和 kimi-4.6 模型的约 10,000 个高质量多轮工具调用轨迹。
📦 2.3 专用数据集:迹反转与代理轨迹
迹反转: 使用专门的逻辑重建器 Trace-Inverter-4B (https://huggingface.co/Jackrong/Trace-Inverter-4B),将压缩的推理气泡逆向工程为完整的、逐步的可学习 CoT 链。这种方法解决了 “信息熵陷阱”——即直接模仿压缩摘要会导致推理断裂——通过确保模型学习连续的、严谨的逻辑推导。
代理轨迹(lambda/hermes-agent-reasoning-traces): 每个样本包含真实的多轮工具执行结果(非捏造输出),并在 <think> 标签内包含逐步推理。覆盖范围包括:
- 终端与编码: 脚本编写、调试、环境配置
- 仓库任务: 修复错误、重构、代码审查
- 浏览器自动化: 网页导航、数据抓取、填表
- 代理工具: 内存持久化、任务委派、技能管理
https://huggingface.co/Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF#%F0%9F%93%8A-3-performance-benchmarks 📊 3. 性能基准测试
📊 评估与性能指标
首个完成的结果:SWE-bench Verified 全 500 题,在无推理模式下评估,用于快速本地代理编码。
⚡ 无推理 SWE-bench 结果
该基准测试特意在 禁用推理 的情况下运行。目的是展示模型在作为快速本地代理使用时(不依赖冗长的可见推理轨迹)的实际编码能力。在配备 MTP 的 RTX 5090 上,模型运行速度约为 100 令牌/秒,使此结果对交互式开发工作流特别重要。
| SWE-bench Verified | 67.0% | 335 / 500 已解决 |
|---|---|---|
| 推理模式 | 关闭推理 | 无需可见 CoT |
| 本地吞吐量 | ~100 t/s | RTX 5090 + MTP |
| 评估构建 | Q5_K_M | 27B GGUF 量化 |
评估设置: SWE-bench Verified 全 500 题,Qwopus-3.6-27B-Coder Q5_K_M GGUF,禁用推理 / 无推理模式。最终分数:335/500 = 67.0%。
💻 3.1 SWE-bench Verified:全 500 题无推理结果
SWE-bench Verified 衡量模型是否能够通过编辑仓库代码并通过隐藏测试来解决真实的 GitHub 问题。在此次运行中,Qwopus-3.6-27B-Coder 在 无推理模式 下解决了 335/500 个验证任务,优先考虑直接行动质量和本地速度,而非冗长的显式推理。
| 指标 | 结果 | 备注 |
|---|---|---|
| 最终分数 | 335/500 = 67.0% | 完整的 SWE-bench Verified 500 任务拆分 |
| 模式 | 关闭推理 | 评估期间无长链显式推理 |
| 量化 | Q5_K_M GGUF | 本地 27B 量化部署 |
| 吞吐量 | ~100 令牌/秒 | 在配备 MTP 的 RTX 5090 上观察到 |
🧩 3.2 仓库级分解
结果在实用库维护任务(如 scikit-learn、xarray、requests 和 Django)上最强,同时在符号数学、测试基础设施、文档工具和绘图库上也有不错的表现。
| 仓库 | 解决率 |
|---|---|
| scikit-learn | 27/32 = 84% |
| pydata/xarray | 18/22 = 82% |
| psf/requests | 6/8 = 75% |
| django | 166/231 = 72% |
| sympy | 48/75 = 64% |
| pytest | 12/19 = 63% |
| sphinx-doc | 26/44 = 59% |
| matplotlib | 20/34 = 59% |
| astropy | 9/22 = 41% |
| pylint | 2/10 = 20% |
⚖️ 3.3 SWE-bench Verified 参考对比
重要对比说明: 下方参考分数来自外部模型报告,通常为 启用推理 或特定 harness 下的结果(已注明)。Qwopus-3.6-27B-Coder 在此处展示为 无推理、量化的本地运行,因此该表应作为定位参考,而非严格的同模式排行榜。
| 模型 | 推理模式 | SWE-bench Verified | 备注 |
|---|---|---|---|
| Qwopus-3.6-27B-Coder | 关闭 / 无推理 | 67.0 | Q5_K_M, RTX 5090 + MTP, ~100 t/s |
| OpenAI GPT-5 | 启用 | 70.1 | 启用推理参考 |
| OpenAI GPT-5 mini | 启用 | 59.8 | 启用推理参考 |
| OpenAI GPT-5 nano | 启用 | 34.8 | 启用推理参考 |
| GLM-4.7 | 启用 | 70.6 | OpenHands 参考 |
| GLM-4.5-Air | 启用 | 57.6 | OpenHands 参考 |
| Qwen3-Coder-30B-A3B-Instruct (2025-07) | 关闭 / 无推理 | 70.3 | 无推理参考 |
| Claude 4.0 Opus | 启用 | 67.6 | 启用推理参考 |
| Claude 4.5 Opus | 启用 | 80.9 | 启用推理参考 |
| Qwen3.6-27B | 启用 | 77.2 | 启用推理参考 |
| Qwen3.5-397B-A17B | 启用 | 76.2 | 启用推理参考 |
| Qwen3.5-27B | 启用 | 75.0 | 启用推理参考 |
| Qwen3.6-35B-A3B | 启用 | 73.4 | 启用推理参考 |
| Gemma4-31B | 启用 | 52.0 | 启用推理参考 |
| Gemma4-26B-A4B | 启用 | 17.4 | 启用推理参考 |
🎮 3.4 实时无推理演示:Boat Survival
Kyle Hessling 还在一个小型交互式游戏环境中测试了禁用推理的 Qwopus-3.6-27B-Coder。该演示是一个实用的冒烟测试,评估快速决策、指令遵循和本地响应能力,超越静态基准表。
Boat Survival 禁用推理 Qwopus-3.6-27B-Coder 演示截图
结论: 重点不在于此无推理本地运行击败了每个启用推理的前沿参考。重要的是,一个量化的 27B 本地编码器可以在完整的 SWE-bench Verified 拆分上达到 67.0%,同时保持足够的速度以支持交互式代理循环。这使得 Qwopus-3.6-27B-Coder 成为开发者一个实用的选择,能够在不需要长推理模式延迟的情况下获得强大的仓库级修复性能。
https://huggingface.co/Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF#%F0%9F%97%BA%EF%B8%8F-4-training–data-pipeline-overview 🗺️ 4. 训练与数据流水线概述
训练过程融合了 迹反转 数据增强与 三阶段课程学习 流水线。核心工程侧重于逐步扩展上下文长度,同时在重建的推理轨迹和真实代理轨迹上进行训练,以保持输出格式稳定。
[ 🗺️ 迹反转:重建蒸馏工作流 ]
A. 代理模型训练(迹反转器)
开源模型(GLM-5.1 / DS-V4)──► 完整推理链 ──► [ Qwen3-235B 压缩 ] ──► 推理气泡
│ │
└──────────────────► [ 训练 ] ◄──────────┘
(基础:Qwen3-4B-Instruct)
(结果:Trace-Inverter-4B)
B. 反转阶段:重建 Claude-4.7-Max
_______________________________________________________
| |
| Claude-4.7-Max API ──► 压缩气泡 + 答案 |
|_____________________________________________________|
│
▼
[ 🧠 Trace-Inverter-4B(逻辑重建器)] ──► 合成深度推理轨迹(可学习 CoT)
│
▼
[ 🧩 数据拼接 ] ◄──────────(原始提示 + 响应)
(将重建的 CoT 嵌入 <think> 标签,与原始提示/响应拼接)
│
▼
(结果:claude-opus-4.6/4.7 反转集)
C. 最终编码器 SFT 课程流水线
___________________________________________
| |
| 基座模型(Qwopus3.6-27B-v2) |
|_________________________________________|
│
▼
[ 📦 阶段 1:格式起步 ] ──► [ 🛠️ 阶段 2:代理/编码扩展 ] ──► [ 🚀 阶段 3:长上下文 SFT ]
( < 4096 令牌 ) ( 4096 - 8192 令牌 ) ( 8192 - 32K 令牌 )
(稳定格式) (工具轨迹 + 编码任务) (长/多轮上下文)
相似文章
Jackrong/Qwopus3.6-27B-Coder-MTP-GGUF
GGUF量化版本的Qwopus3.6-27B-Coder-MTP模型已发布在Hugging Face上,针对本地推理进行了优化,兼容Transformers、vLLM、SGLang和Unsloth Studio。
Jackrong/Qwopus3.6-27B-v2-MTP-GGUF
Jackrong/Qwopus3.6-27B-v2-MTP-GGUF 是 27B 参数语言模型的 GGUF 量化版本,托管在 Hugging Face 上,并附有使用各种库和工具的说明。
Jackrong/Qwopus3.6-35B-A3B-Coder-MTP-GGUF
在 Hugging Face 上发布,Qwopus-3.6-35B-A3B-Coder 是一个经过微调的混合专家(MoE)编码代理模型,专为高效、低延迟的本地执行而设计,可在代理工作流中减少 token 浪费。
Jackrong/Qwopus3.5-9B-Coder-MTP-GGUF
Jackrong 发布了 Qwopus3.5-9B-Coder-MTP-GGUF,这是一个基于 Qwen 的 9B 代码模型,采用多令牌预测 (MTP) 架构进行微调,相较于基模型实现了 35.8% 的吞吐量提升和 8.3% 的准确率提升,在代码和数学基准测试中取得满分。
Jackrong/Qwopus3.6-35B-A3B-v1-GGUF
Jackrong 发布 Qwopus3.6-35B-A3B-v1,基于阿里巴巴 Qwen3.6 MoE 模型的推理增强微调版本,针对逻辑推理和智能体编程优化,拥有 350 亿总参数和 30 亿激活参数。