@KyleHessling1: 大家早上好!我们发布了Qwopus 3.6 27B-Coder-Compat,为各种测试框架带来了兼容性修复!这个版本…
摘要
Qwopus 3.6 27B-Coder-Compat 是新的GGUF版本,为各种测试框架带来了兼容性修复,减少了循环问题,提高了思考稳定性。它可以生成完整的HTML游戏,适合本地部署。
查看缓存全文
缓存时间: 2026/06/23 08:03
各位早上好!我们发布了 Qwopus 3.6 27B-Coder-Compat,包含针对多个测试框架的兼容性修复!这个版本在更多测试框架上应该会显著减少循环行为。思维稳定性也得到改善,之前很多测试框架在开启该功能时会遇到问题。仍然建议设置较高温度,并确保你的测试框架没有覆盖服务器的温度设置。最好让它在 0.85 到 1 之间运行,而许多测试框架即使你正确配置了服务器,也会推低默认值如 0.1。在这种情况下,你可以修改测试框架特定设置来匹配。我在 Claude Code 中进行了测试,做了一个有趣的马里奥风格横向卷轴游戏!我确实认为 Claude 庞大的系统提示也增加了一些能力,因为它几乎一次就生成了这个游戏,我只是多转了几次,添加了一些我在测试时想到的内容。游戏链接在评论区!Qwopus 甚至为这个游戏生成了音乐和音频,我认为它做得非常棒!不可思议的是,就在几年前,为游戏添加这些内容还需要很长时间,而现在一个本地模型就能原生生成并应用它们!在 5090 上以高速迭代本地制作功能丰富的 HTML 游戏,是本地模型的一个绝佳展示!而且,一旦你想到新的游戏机制和关卡,就会忍不住继续添加。稳定性令人难以置信;我从未遇到过输出完全无效的情况。所有改动都在第一次尝试时顺利运行!那么,是什么阻止你使用 Qwopus 或任何这些本地模型发布一个 App Store 游戏呢?它们完全有能力做到!作为一个独立开发者,你可以通过循环迭代和令人难以置信的深度来尽情发挥!如果你构建了什么东西,请把链接发给我,我很想看看!如果你之前在你的测试框架或使用场景中遇到循环问题,请尝试这个应用了修复的新版本,并告诉我们你的想法!朋友们,这总是令人愉快的事情!祝你们周一愉快!35B-coder MOE 也即将推出!
Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF · Hugging Face
来源:https://huggingface.co/Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF
🟢 Qwopus3.6-27B-Coder-Compat-MTP-GGUF 兼容版
Bundled-MTP GGUF 发布,扩展了聊天模板的互操作性,适用于工具使用运行时和兼容 OpenAI 的代理历史记录。 ✓ JSON 字符串参数 ✓ 映射与列表参数 ✓ llama.cpp / minja ✓ Hugging Face Jinja ⚡ Bundled MTP 🧠 权重一致验证
🌐 专注于兼容性的模板更新
此版本扩展了跨代理框架的互操作性,这些框架以不同的有效表示存储历史 tool_call.function.arguments。内嵌模板接受预序列化的 JSON 字符串以及结构化的映射和列表,同时保留原始工具调用负载。这是一次模板层面的兼容性更新:模型权重和捆绑的 MTP 预测张量保持不变。
- HF 模板渲染:10 / 10 - 所有兼容性案例成功渲染。
- llama.cpp / minja:10 / 10 - 命令和参数准确保留。
- 循环回归:0 次循环 - 10/10 案例;无格式错误的工具调用循环。
- MTP 接受率:76.81% - 1,229 个草稿令牌中有 944 个被接受。
📊 权重一致的 Q4_K_M 模板对比
| 指标 | 兼容模板 | 官方模板 |
|---|---|---|
| HF 渲染 | 10/10 | 3/10 |
| minja 渲染 | 10/10 | 9/10 |
| 编码质量 | 1.70 / 2 | 1.70 / 2 |
| 中位解码速度 | 30.53 tok/s | 29.92 tok/s |
| MTP 接受率 | 76.81% | 76.41% |
| 提示令牌数(速度集) | 11,150 | 12,238 |
验证使用了两个 Q4_K_M GGUF 文件,所有 866 个张量(包括捆绑的 MTP/NextN 张量)的逐张量 SHA-256 清单完全相同。测试在 NVIDIA GB10 上进行,使用 llama.cpp build 9733,32K 上下文,一个并行槽,启用 Jinja,禁用推理,启用 MTP 草稿解码。测得的兼容模板速度差异为 +2.06%,属于正常运行时波动范围。
兼容性范围: 此更新针对聊天历史序列化和 Hugging Face Jinja、llama.cpp/minja 以及兼容 OpenAI 的工具调用表示中的模板渲染。它不会改变训练好的模型权重、编码专长、视觉能力或 MTP 架构。
🤝 模板更新由 Kyle Hessling 完成
此兼容模板修改由 Kyle Hessling 完成。非常感谢 Kyle 在支持的工具调用格式和运行时中实现并验证了此更新。如果你遇到任何与模板相关的问题,请在 X 上关注并联系 Kyle 分享你的反馈:@KyleHessling1 (https://x.com/KyleHessling1)。
https://huggingface.co/Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF#original-qwopus36-27b-coder-mtp-gguf-model-card
原始 Qwopus3.6-27B-Coder-MTP-GGUF 模型卡
完整的原始模型卡保留在下方,包含模型背景、训练细节、基准测试、使用指南、资源、致谢和引用。
🪐 Qwopus-3.6-27B-Coder Coder SFT 发布
代理编码与工具使用推理模型 基于 Qwopus3.6-27B-v2 微调 🧬 轨迹反转与负熵 🧠 27B 密集模型 ⚡ 代理编码 🛠️ 工具调用与代理 🏆 SWE-bench Verified: 67.0% (关闭思考)
💡 Qwopus-3.6-27B-Coder 是什么?
🪐 Qwopus-3.6-27B-Coder 是一个基于 Qwopus3.6-27B-v2 构建的推理增强型代理编码模型。它继承了 v2 基座的强大推理基础——在 MMLU-Pro (300ex) 上达到 87.43%,在 SWE-bench Verified 上达到 75.25%——并进一步专精于代理代码生成、结构化工具调用、调试以及在开发者工作流中的指令遵循。该模型旨在在真实的代理环境中,在仓库级别编码任务、多轮工具编排和复杂逻辑推理方面表现出色。
- 🧩 代理编码: 针对仓库级别编码、调试、补丁生成和结构化多步开发工作流进行了优化。
- 🛠️ 工具调用: 从包含工具定义、工具调用和环境反馈的真实代理轨迹中学习,以实现稳健的多轮执行。
- 🧬 轨迹反转: 继承了完整的 Qwopus 训练配方,使用来自 Claude Opus 的重建逐步推理轨迹。
- 🚀 27B 规模: 密集 27B 参数,原生支持长上下文,在提供深度推理的同时,可在单 GPU 上实际部署。
社区发布通知: Qwopus-3.6-27B-Coder 是一个实验性的社区发布,旨在用于研究、评估和代理工作流探索。它尚未经过全面的安全评估或广泛的一般领域基准测试。 基准测试状态: 第一个完成的基准测试是 SWE-bench Verified 完整 500 项,在 关闭思考/无思考模式 下进行,Q5_K_M 27B GGUF 运行解决了 335/500 = 67.0% 的问题。其他基准测试套件仍在等待中,将在测试完成后更新。
https://huggingface.co/Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF#%F0%9F%92%A1-1-base-model-training-stack–collaboration
💡 1. 基座模型、训练栈与协作
🧠 1.1 基座模型: Qwopus3.6-27B-v2
Qwopus3.6-27B-v2 是一个基于 Qwen3.6-27B 构建的推理增强型密集语言模型。通过多阶段课程学习流程和轨迹反转增强,它在知识、编码和推理基准测试中取得了强大性能。此编码变体继承了这一基础,并扩展了专门的编码和工具使用数据。
| 属性 | 规格与详情 |
|---|---|
| 🧠 架构 | 密集 Transformer / 270 亿参数 |
| 🏢 基础开发者 | 阿里云(达摩院)— Qwen3.6-27B |
| 🎯 主要焦点 | 代理编码、工具使用稳定性、代码调试、结构化指令遵循、仓库级别任务 |
| 🧬 蒸馏策略 | 轨迹反转 + 高质量代理轨迹 + 课程 SFT |
| 📄 上下文窗口 | 原生支持最高 32K 令牌(微调目标);通过 RoPE/YaRN 缩放兼容更长上下文 |
🧪 1.2 硬件合作与联合协作
本项目是与工程师 Kyle Hessling 密切合作、共同努力的成果,他的硬件基础设施和训练支持使得稳定的 27B 规模微调和评估成为可能。 👉 你可以在 X/Twitter 上关注他以获取硬件和模型训练更新:@KyleHessling1 (https://x.com/KyleHessling1)
🦥 1.3 微调框架 (Unsloth)
模型训练工作流借助 Unsloth 实现加速和内存优化。特别感谢 Unsloth 团队让高效的大模型微调变得触手可及。
⚡ 1.4 MTP 变体:更快的推测解码
该模型还提供了 多令牌预测 (MTP) 变体,具有辅助预测头 (draft=2),用于推测解码。基于 Qwopus3.6-27B-v2-MTP 基准,MTP 变体在保持精度的同时实现了约 1.66 倍速度提升。有关详细的 MTP 性能分析,请参见 Qwopus3.6-27B-v2-MTP (https://huggingface.co/Jackrong/Qwopus3.6-27B-v2-MTP) 模型卡。
🌟 定制的 MTP 头处理流程已在 qwen-mtp-gguf (https://github.com/R6410418/Jackrong-llm-finetuning-guide/tree/main/qwen-mtp-gguf) 开源。如果你觉得这个工具包有帮助,请考虑在 GitHub 上给个星标!
https://huggingface.co/Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF#%F0%9F%93%96-2-background–motivation
📖 2. 背景与动机
🎯 2.1 为什么选择 27B 编码模型?
Qwopus 编码系列在 4B 和 9B 规模上已显示出强劲效果。27B 编码变体代表了在推理深度、代码生成质量和工具使用稳健性方面的一次显著飞跃。在 270 亿参数规模上,该模型有足够的能力内化复杂的仓库结构、多文件依赖关系以及细微的工具调用模式——同时仍可在单 GPU(例如 RTX 5090)上部署。这个规模弥合了紧凑型本地模型和昂贵的基于 API 的解决方案之间的差距,使其适用于生产中的代理编码工作流。
🧬 2.2 轨迹反转与代理行为
商业和前沿模型通常仅暴露压缩的推理摘要。Qwopus 风格的训练使用 轨迹反转 将这些压缩的“推理气泡”重建为更完整、可学习的推理轨迹。对于编码,这与包含工具定义、工具调用和真实反馈的代理轨迹相结合,教导模型通过交互式工作进行推理,而不仅仅是产生静态答案。该模型整合了:
- claude-opus-4.6-traceInversion-9000x:9,000 个高价值、完全重建的逐步推理轨迹。
- claude-opus-4.7-traceInversion-5000x:5,000 个复杂多轮逻辑和数学样本,针对负熵重建进行了优化。
- lambda/hermes-agent-reasoning-traces:约 10,000 个来自 GLM-5.1 和 kimi-4.6 模型的高质量多轮工具调用轨迹。
📦 2.3 特殊数据集:轨迹反转与代理轨迹
轨迹反转: 使用专门的逻辑重建器 Trace-Inverter-4B (https://huggingface.co/Jackrong/Trace-Inverter-4B),将压缩的推理气泡逆向工程为完整的、逐步可学习的 CoT 链。这种方法解决了 “信息熵陷阱”——即直接模仿压缩摘要会导致推理断裂——通过确保模型学习连续、严谨的逻辑推导。
代理轨迹 (lambda/hermes-agent-reasoning-traces): 每个样本都包含真实的多轮工具执行结果(非虚构输出),并带有 ... 标签内的逐步推理。覆盖范围包括:
- 终端与编码: 脚本编写、调试、环境配置
- 仓库任务: 错误修复、重构、代码审查
- 浏览器自动化: 网页导航、抓取、表单填写
- 代理工具: 记忆持久化、任务委派、技能管理
https://huggingface.co/Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF#%F0%9F%93%8A-3-performance-benchmarks
📊 3. 性能基准测试
📊 评估与性能指标
首次完成的结果:SWE-bench Verified 完整 500 项,在无思考模式下评估,以实现快速本地代理编码。
⚡ 无思考 SWE-bench 结果
此基准测试特意在 禁用思考 状态下运行。目标是展示模型作为快速本地代理时的实际编码能力,而不是依赖长的可见推理轨迹。在启用 MTP 的 RTX 5090 上,模型运行速度约为 100 令牌/秒,这使得该结果对于交互式开发工作流尤其相关。
| 指标 | 结果 |
|---|---|
| SWE-bench Verified | 67.0% — 335 / 500 已解决 |
| 推理模式 | 关闭思考 — 无需可见 CoT |
| 本地吞吐量 | ~100 t/s — RTX 5090 + MTP |
| 评估版本 | Q5_K_M 27B GGUF 量化 |
评估设置: SWE-bench Verified 完整 500 项,Qwopus-3.6-27B-Coder Q5_K_M GGUF,关闭思考/无思考模式。最终得分:335/500 = 67.0%。
💻 3.1 SWE-bench Verified: 完整 500 项无思考结果
SWE-bench Verified 衡量模型是否能够通过编辑仓库代码并通过隐藏测试来解决真实的 GitHub 问题。在此次运行中,Qwopus-3.6-27B-Coder 在 无思考模式 下解决了 335 个 已验证任务中的 500 个,优先考虑直接行动质量和本地速度,而非长的显式推理。
| 指标 | 结果 | 备注 |
|---|---|---|
| 最终得分 | 335/500 = 67.0% | 完整 SWE-bench Verified 500 项拆分 |
| 模式 | 关闭思考 | 评估期间无长可见思维链 |
| 量化 | Q5_K_M GGUF | 本地 27B 量化部署 |
| 吞吐量 | ~100 令牌/秒 | 在启用 MTP 的 RTX 5090 上观察到 |
🧩 3.2 仓库级别细分
该结果在实用的库维护任务上最强,例如 scikit-learn、xarray、requests 和 Django,同时在符号数学、测试基础设施、文档工具和绘图库方面也显示了扎实的覆盖率。
| 仓库 | 已解决率 |
|---|---|
| scikit-learn | 27/32 — 84% |
| pydata/xarray | 18/22 — 82% |
| psf/requests | 6/8 — 75% |
| django | 166/231 — 72% |
| sympy | 48/75 — 64% |
| pytest | 12/19 — 63% |
| sphinx-doc | 26/44 — 59% |
| matplotlib | 20/34 — 59% |
| astropy | 9/22 — 41% |
| pylint | 2/10 — 20% |
⚖️ 3.3 SWE-bench Verified 参考对比
重要对比说明: 以下参考分数来自外部模型报告,通常是 启用思考 或特定测试框架的结果。Qwopus-3.6-27B-Coder 在此展示的是 无思考、量化本地运行,因此该表格应作为定位背景阅读,而非严格的同模式排行榜。
| 模型 | 思考模式 | SWE-bench Verified | 上下文 |
|---|---|---|---|
| Qwopus-3.6-27B-Coder | 关闭/无思考 | 67.0 | Q5_K_M, RTX 5090 + MTP, ~100 t/s |
| OpenAI GPT-5 | 开启 | 70.1 | 开启思考参考 |
| OpenAI GPT-5 mini | 开启 | 59.8 | 开启思考参考 |
| OpenAI GPT-5 nano | 开启 | 34.8 | 开启思考参考 |
| GLM-4.7 | 开启 | 70.6 | OpenHands 参考 |
| GLM-4.5-Air | 开启 | 57.6 | OpenHands 参考 |
| Qwen3-Coder-30B-A3B-Instruct (2025-07) | 关闭/无思考 | 70.3 | 无思考参考 |
| Claude 4.0 Opus | 开启 | 67.6 | 开启思考参考 |
| Claude 4.5 Opus | 开启 | 80.9 | 开启思考参考 |
| Qwen3.6-27B | 开启 | 77.2 | 开启思考参考 |
| Qwen3.5-397B-A17B | 开启 | 76.2 | 开启思考参考 |
| Qwen3.5-27B | 开启 | 75.0 | 开启思考参考 |
| Qwen3.6-35B-A3B | 开启 | 73.4 | 开启思考参考 |
| Gemma4-31B | 开启 | 52.0 | 开启思考参考 |
| Gemma4-26B-A4B | 开启 | 17.4 | 开启思考参考 |
🎮 3.4 实时禁用思考演示:Boat Survival
Kyle Hessling 还在一个小型交互游戏环境中测试了 Qwopus-3.6-27B-Coder,禁用了思考。该演示是对快速决策、指令遵循和本地响应能力的一次实际烟雾测试,超越了静态基准表格。
Boat Survival thinking-disabled Qwopus-3.6-27B-Coder demo screenshot (https://huggingface.co/spaces/KyleHessling1/Boat-Survival-Thinking-Disabled-Qwopus-3.6-27B-Coder)
要点: 重点不在于这次无思考的本地运行击败了所有启用思考的前沿参考。重要的结果是,一个量化的 2
相似文章
@KyleHessling1:大家早上好!Qwopus-3.6-35B-A3B-MTP-Coder 已上线!所有 GGUF 将在接下来几小时内填充!这是一个…
Qwopus-3.6-35B-A3B-MTP-Coder 是一个新的开源 MoE 微调模型,针对禁用思考过程的编码智能体工作流进行了优化,提供快速且高效的推理,与同类模型相比具有竞争力的性能。
Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF
Jackrong 发布了 Qwopus3.6-27B-Coder-Compat-MTP-GGUF,这是 Qwopus3.6-27B-Coder 模型的 GGUF 量化版本,并扩展了聊天模板,以提升与工具使用运行时及 OpenAI 兼容的代理框架的互操作性。
@loktar00: 不明白为什么Kyle没有几万粉丝。他几乎每天都在发布非常酷又实用的东西……
Kyle Hessling 宣布发布 Qwopus-3.6-35B-A3B-MTP-Coder,一个专为编码优化的快速MOE模型,提供GGUF格式。
@outsource_: 重大消息:QWOPUS 3.6 27B 已全面上线!SOTA QWEN 3.6 27b + Opus 来了!智能编码王者:75.25%(152/202)在……
Qwopus 3.6 27B 现已全面上线,这是一个融合模型(Qwen + Opus),在 SWE MMLU Pro 上实现了最先进的智能编码性能,达到 75.25%,支持 Q8 KV 缓存下的 303k token 上下文,在 Q5_K_M 量化下仅需 24GB VRAM 即可运行。
Jackrong/Qwopus3.6-27B-Coder-MTP-GGUF
GGUF量化版本的Qwopus3.6-27B-Coder-MTP模型已发布在Hugging Face上,针对本地推理进行了优化,兼容Transformers、vLLM、SGLang和Unsloth Studio。