@KyleHessling1: 大家早上好!我们发布了Qwopus 3.6 27B-Coder-Compat,为各种测试框架带来了兼容性修复!这个版本…

X AI KOLs Timeline 模型

摘要

Qwopus 3.6 27B-Coder-Compat 是新的GGUF版本,为各种测试框架带来了兼容性修复,减少了循环问题,提高了思考稳定性。它可以生成完整的HTML游戏,适合本地部署。

大家早上好! 我们发布了Qwopus 3.6 27B-Coder-Compat,为各种测试框架带来了兼容性修复! 这个版本在更多测试框架上应显著减少循环行为。思考稳定性也得到了改善,之前许多其他测试框架在启用该功能时都存在一些问题! 仍然需要保持高温运行,并确保你的测试框架不会覆盖服务器的温度设置。最佳运行温度在0.85到1之间,而许多测试框架即使在服务器设置正确的情况下,也会推送低默认值,比如0.1。在这种情况下,你可以修改特定测试框架的设置来匹配。 我在Claude Code中测试了它,制作了一个好玩的马里奥风格横向卷轴游戏!我绝对认为Claude庞大的系统提示也增强了一些能力,因为它几乎一次就生成了这个游戏,我后来又调整了几次,添加了一些我在测试时想到的内容。游戏链接在评论区! Qwopus甚至为这个游戏生成了音乐和音频,我觉得它做得非常出色!令人难以置信的是,几年前这些功能添加到游戏中需要花费很长时间,而现在一个本地模型竟然能原生生成并应用它们! 在5090上本地制作功能丰富的HTML游戏,并实现高速迭代,是本地模型的绝佳展示!同时,不断添加你想到的游戏机制和关卡也让人上瘾。稳定性令人惊叹;我从未遇到任何无效输出。所有修改在第一次运行时就表现良好! 那么,是什么阻止你用Qwopus或任何这些本地模型向应用商店发布游戏呢?它们完全有能力做到!作为一名独立开发者,你可以疯狂地进行循环迭代,带来令人难以置信的深度!如果你做了什么东西,请把链接发给我,我很乐意去看看! 如果你之前在测试框架或使用中遇到过循环问题,请尝试这个带有修复的新版本,并告诉我们你的感受! 一如既往,很高兴与大家交流!祝周一愉快! 35B-coder MOE也即将发布!
查看原文
查看缓存全文

缓存时间: 2026/06/23 08:03

各位早上好!我们发布了 Qwopus 3.6 27B-Coder-Compat,包含针对多个测试框架的兼容性修复!这个版本在更多测试框架上应该会显著减少循环行为。思维稳定性也得到改善,之前很多测试框架在开启该功能时会遇到问题。仍然建议设置较高温度,并确保你的测试框架没有覆盖服务器的温度设置。最好让它在 0.85 到 1 之间运行,而许多测试框架即使你正确配置了服务器,也会推低默认值如 0.1。在这种情况下,你可以修改测试框架特定设置来匹配。我在 Claude Code 中进行了测试,做了一个有趣的马里奥风格横向卷轴游戏!我确实认为 Claude 庞大的系统提示也增加了一些能力,因为它几乎一次就生成了这个游戏,我只是多转了几次,添加了一些我在测试时想到的内容。游戏链接在评论区!Qwopus 甚至为这个游戏生成了音乐和音频,我认为它做得非常棒!不可思议的是,就在几年前,为游戏添加这些内容还需要很长时间,而现在一个本地模型就能原生生成并应用它们!在 5090 上以高速迭代本地制作功能丰富的 HTML 游戏,是本地模型的一个绝佳展示!而且,一旦你想到新的游戏机制和关卡,就会忍不住继续添加。稳定性令人难以置信;我从未遇到过输出完全无效的情况。所有改动都在第一次尝试时顺利运行!那么,是什么阻止你使用 Qwopus 或任何这些本地模型发布一个 App Store 游戏呢?它们完全有能力做到!作为一个独立开发者,你可以通过循环迭代和令人难以置信的深度来尽情发挥!如果你构建了什么东西,请把链接发给我,我很想看看!如果你之前在你的测试框架或使用场景中遇到循环问题,请尝试这个应用了修复的新版本,并告诉我们你的想法!朋友们,这总是令人愉快的事情!祝你们周一愉快!35B-coder MOE 也即将推出!


Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF · Hugging Face

来源:https://huggingface.co/Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF

🟢 Qwopus3.6-27B-Coder-Compat-MTP-GGUF 兼容版

Bundled-MTP GGUF 发布,扩展了聊天模板的互操作性,适用于工具使用运行时和兼容 OpenAI 的代理历史记录。 ✓ JSON 字符串参数 ✓ 映射与列表参数 ✓ llama.cpp / minja ✓ Hugging Face Jinja ⚡ Bundled MTP 🧠 权重一致验证

🌐 专注于兼容性的模板更新

此版本扩展了跨代理框架的互操作性,这些框架以不同的有效表示存储历史 tool_call.function.arguments。内嵌模板接受预序列化的 JSON 字符串以及结构化的映射和列表,同时保留原始工具调用负载。这是一次模板层面的兼容性更新:模型权重和捆绑的 MTP 预测张量保持不变。

  • HF 模板渲染:10 / 10 - 所有兼容性案例成功渲染。
  • llama.cpp / minja:10 / 10 - 命令和参数准确保留。
  • 循环回归:0 次循环 - 10/10 案例;无格式错误的工具调用循环。
  • MTP 接受率:76.81% - 1,229 个草稿令牌中有 944 个被接受。

📊 权重一致的 Q4_K_M 模板对比

指标兼容模板官方模板
HF 渲染10/103/10
minja 渲染10/109/10
编码质量1.70 / 21.70 / 2
中位解码速度30.53 tok/s29.92 tok/s
MTP 接受率76.81%76.41%
提示令牌数(速度集)11,15012,238

验证使用了两个 Q4_K_M GGUF 文件,所有 866 个张量(包括捆绑的 MTP/NextN 张量)的逐张量 SHA-256 清单完全相同。测试在 NVIDIA GB10 上进行,使用 llama.cpp build 9733,32K 上下文,一个并行槽,启用 Jinja,禁用推理,启用 MTP 草稿解码。测得的兼容模板速度差异为 +2.06%,属于正常运行时波动范围。

兼容性范围: 此更新针对聊天历史序列化和 Hugging Face Jinja、llama.cpp/minja 以及兼容 OpenAI 的工具调用表示中的模板渲染。它不会改变训练好的模型权重、编码专长、视觉能力或 MTP 架构。

🤝 模板更新由 Kyle Hessling 完成

此兼容模板修改由 Kyle Hessling 完成。非常感谢 Kyle 在支持的工具调用格式和运行时中实现并验证了此更新。如果你遇到任何与模板相关的问题,请在 X 上关注并联系 Kyle 分享你的反馈:@KyleHessling1 (https://x.com/KyleHessling1)。


https://huggingface.co/Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF#original-qwopus36-27b-coder-mtp-gguf-model-card

原始 Qwopus3.6-27B-Coder-MTP-GGUF 模型卡

完整的原始模型卡保留在下方,包含模型背景、训练细节、基准测试、使用指南、资源、致谢和引用。

🪐 Qwopus-3.6-27B-Coder Coder SFT 发布

代理编码与工具使用推理模型 基于 Qwopus3.6-27B-v2 微调 🧬 轨迹反转与负熵 🧠 27B 密集模型 ⚡ 代理编码 🛠️ 工具调用与代理 🏆 SWE-bench Verified: 67.0% (关闭思考)

💡 Qwopus-3.6-27B-Coder 是什么?

🪐 Qwopus-3.6-27B-Coder 是一个基于 Qwopus3.6-27B-v2 构建的推理增强型代理编码模型。它继承了 v2 基座的强大推理基础——在 MMLU-Pro (300ex) 上达到 87.43%,在 SWE-bench Verified 上达到 75.25%——并进一步专精于代理代码生成、结构化工具调用、调试以及在开发者工作流中的指令遵循。该模型旨在在真实的代理环境中,在仓库级别编码任务、多轮工具编排和复杂逻辑推理方面表现出色。

  • 🧩 代理编码: 针对仓库级别编码、调试、补丁生成和结构化多步开发工作流进行了优化。
  • 🛠️ 工具调用: 从包含工具定义、工具调用和环境反馈的真实代理轨迹中学习,以实现稳健的多轮执行。
  • 🧬 轨迹反转: 继承了完整的 Qwopus 训练配方,使用来自 Claude Opus 的重建逐步推理轨迹。
  • 🚀 27B 规模: 密集 27B 参数,原生支持长上下文,在提供深度推理的同时,可在单 GPU 上实际部署。

社区发布通知: Qwopus-3.6-27B-Coder 是一个实验性的社区发布,旨在用于研究、评估和代理工作流探索。它尚未经过全面的安全评估或广泛的一般领域基准测试。 基准测试状态: 第一个完成的基准测试是 SWE-bench Verified 完整 500 项,在 关闭思考/无思考模式 下进行,Q5_K_M 27B GGUF 运行解决了 335/500 = 67.0% 的问题。其他基准测试套件仍在等待中,将在测试完成后更新。


https://huggingface.co/Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF#%F0%9F%92%A1-1-base-model-training-stack–collaboration

💡 1. 基座模型、训练栈与协作

🧠 1.1 基座模型: Qwopus3.6-27B-v2

Qwopus3.6-27B-v2 是一个基于 Qwen3.6-27B 构建的推理增强型密集语言模型。通过多阶段课程学习流程和轨迹反转增强,它在知识、编码和推理基准测试中取得了强大性能。此编码变体继承了这一基础,并扩展了专门的编码和工具使用数据。

属性规格与详情
🧠 架构密集 Transformer / 270 亿参数
🏢 基础开发者阿里云(达摩院)— Qwen3.6-27B
🎯 主要焦点代理编码、工具使用稳定性、代码调试、结构化指令遵循、仓库级别任务
🧬 蒸馏策略轨迹反转 + 高质量代理轨迹 + 课程 SFT
📄 上下文窗口原生支持最高 32K 令牌(微调目标);通过 RoPE/YaRN 缩放兼容更长上下文

🧪 1.2 硬件合作与联合协作

本项目是与工程师 Kyle Hessling 密切合作、共同努力的成果,他的硬件基础设施和训练支持使得稳定的 27B 规模微调和评估成为可能。 👉 你可以在 X/Twitter 上关注他以获取硬件和模型训练更新:@KyleHessling1 (https://x.com/KyleHessling1)

🦥 1.3 微调框架 (Unsloth)

模型训练工作流借助 Unsloth 实现加速和内存优化。特别感谢 Unsloth 团队让高效的大模型微调变得触手可及。

⚡ 1.4 MTP 变体:更快的推测解码

该模型还提供了 多令牌预测 (MTP) 变体,具有辅助预测头 (draft=2),用于推测解码。基于 Qwopus3.6-27B-v2-MTP 基准,MTP 变体在保持精度的同时实现了约 1.66 倍速度提升。有关详细的 MTP 性能分析,请参见 Qwopus3.6-27B-v2-MTP (https://huggingface.co/Jackrong/Qwopus3.6-27B-v2-MTP) 模型卡。 🌟 定制的 MTP 头处理流程已在 qwen-mtp-gguf (https://github.com/R6410418/Jackrong-llm-finetuning-guide/tree/main/qwen-mtp-gguf) 开源。如果你觉得这个工具包有帮助,请考虑在 GitHub 上给个星标!


https://huggingface.co/Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF#%F0%9F%93%96-2-background–motivation

📖 2. 背景与动机

🎯 2.1 为什么选择 27B 编码模型?

Qwopus 编码系列在 4B 和 9B 规模上已显示出强劲效果。27B 编码变体代表了在推理深度、代码生成质量和工具使用稳健性方面的一次显著飞跃。在 270 亿参数规模上,该模型有足够的能力内化复杂的仓库结构、多文件依赖关系以及细微的工具调用模式——同时仍可在单 GPU(例如 RTX 5090)上部署。这个规模弥合了紧凑型本地模型和昂贵的基于 API 的解决方案之间的差距,使其适用于生产中的代理编码工作流。

🧬 2.2 轨迹反转与代理行为

商业和前沿模型通常仅暴露压缩的推理摘要。Qwopus 风格的训练使用 轨迹反转 将这些压缩的“推理气泡”重建为更完整、可学习的推理轨迹。对于编码,这与包含工具定义、工具调用和真实反馈的代理轨迹相结合,教导模型通过交互式工作进行推理,而不仅仅是产生静态答案。该模型整合了:

  • claude-opus-4.6-traceInversion-9000x:9,000 个高价值、完全重建的逐步推理轨迹。
  • claude-opus-4.7-traceInversion-5000x:5,000 个复杂多轮逻辑和数学样本,针对负熵重建进行了优化。
  • lambda/hermes-agent-reasoning-traces:约 10,000 个来自 GLM-5.1 和 kimi-4.6 模型的高质量多轮工具调用轨迹。

📦 2.3 特殊数据集:轨迹反转与代理轨迹

轨迹反转: 使用专门的逻辑重建器 Trace-Inverter-4B (https://huggingface.co/Jackrong/Trace-Inverter-4B),将压缩的推理气泡逆向工程为完整的、逐步可学习的 CoT 链。这种方法解决了 “信息熵陷阱”——即直接模仿压缩摘要会导致推理断裂——通过确保模型学习连续、严谨的逻辑推导。 代理轨迹 (lambda/hermes-agent-reasoning-traces): 每个样本都包含真实的多轮工具执行结果(非虚构输出),并带有 ... 标签内的逐步推理。覆盖范围包括:

  • 终端与编码: 脚本编写、调试、环境配置
  • 仓库任务: 错误修复、重构、代码审查
  • 浏览器自动化: 网页导航、抓取、表单填写
  • 代理工具: 记忆持久化、任务委派、技能管理

https://huggingface.co/Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF#%F0%9F%93%8A-3-performance-benchmarks

📊 3. 性能基准测试

📊 评估与性能指标

首次完成的结果:SWE-bench Verified 完整 500 项,在无思考模式下评估,以实现快速本地代理编码。

⚡ 无思考 SWE-bench 结果

此基准测试特意在 禁用思考 状态下运行。目标是展示模型作为快速本地代理时的实际编码能力,而不是依赖长的可见推理轨迹。在启用 MTP 的 RTX 5090 上,模型运行速度约为 100 令牌/秒,这使得该结果对于交互式开发工作流尤其相关。

指标结果
SWE-bench Verified67.0% — 335 / 500 已解决
推理模式关闭思考 — 无需可见 CoT
本地吞吐量~100 t/s — RTX 5090 + MTP
评估版本Q5_K_M 27B GGUF 量化

评估设置: SWE-bench Verified 完整 500 项,Qwopus-3.6-27B-Coder Q5_K_M GGUF,关闭思考/无思考模式。最终得分:335/500 = 67.0%

💻 3.1 SWE-bench Verified: 完整 500 项无思考结果

SWE-bench Verified 衡量模型是否能够通过编辑仓库代码并通过隐藏测试来解决真实的 GitHub 问题。在此次运行中,Qwopus-3.6-27B-Coder 在 无思考模式 下解决了 335 个 已验证任务中的 500 个,优先考虑直接行动质量和本地速度,而非长的显式推理。

指标结果备注
最终得分335/500 = 67.0%完整 SWE-bench Verified 500 项拆分
模式关闭思考评估期间无长可见思维链
量化Q5_K_M GGUF本地 27B 量化部署
吞吐量~100 令牌/秒在启用 MTP 的 RTX 5090 上观察到

🧩 3.2 仓库级别细分

该结果在实用的库维护任务上最强,例如 scikit-learn、xarray、requests 和 Django,同时在符号数学、测试基础设施、文档工具和绘图库方面也显示了扎实的覆盖率。

仓库已解决率
scikit-learn27/32 — 84%
pydata/xarray18/22 — 82%
psf/requests6/8 — 75%
django166/231 — 72%
sympy48/75 — 64%
pytest12/19 — 63%
sphinx-doc26/44 — 59%
matplotlib20/34 — 59%
astropy9/22 — 41%
pylint2/10 — 20%

⚖️ 3.3 SWE-bench Verified 参考对比

重要对比说明: 以下参考分数来自外部模型报告,通常是 启用思考 或特定测试框架的结果。Qwopus-3.6-27B-Coder 在此展示的是 无思考、量化本地运行,因此该表格应作为定位背景阅读,而非严格的同模式排行榜。

模型思考模式SWE-bench Verified上下文
Qwopus-3.6-27B-Coder关闭/无思考67.0Q5_K_M, RTX 5090 + MTP, ~100 t/s
OpenAI GPT-5开启70.1开启思考参考
OpenAI GPT-5 mini开启59.8开启思考参考
OpenAI GPT-5 nano开启34.8开启思考参考
GLM-4.7开启70.6OpenHands 参考
GLM-4.5-Air开启57.6OpenHands 参考
Qwen3-Coder-30B-A3B-Instruct (2025-07)关闭/无思考70.3无思考参考
Claude 4.0 Opus开启67.6开启思考参考
Claude 4.5 Opus开启80.9开启思考参考
Qwen3.6-27B开启77.2开启思考参考
Qwen3.5-397B-A17B开启76.2开启思考参考
Qwen3.5-27B开启75.0开启思考参考
Qwen3.6-35B-A3B开启73.4开启思考参考
Gemma4-31B开启52.0开启思考参考
Gemma4-26B-A4B开启17.4开启思考参考

🎮 3.4 实时禁用思考演示:Boat Survival

Kyle Hessling 还在一个小型交互游戏环境中测试了 Qwopus-3.6-27B-Coder,禁用了思考。该演示是对快速决策、指令遵循和本地响应能力的一次实际烟雾测试,超越了静态基准表格。

Boat Survival thinking-disabled Qwopus-3.6-27B-Coder demo screenshot (https://huggingface.co/spaces/KyleHessling1/Boat-Survival-Thinking-Disabled-Qwopus-3.6-27B-Coder)

要点: 重点不在于这次无思考的本地运行击败了所有启用思考的前沿参考。重要的结果是,一个量化的 2

相似文章

Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF

Hugging Face Models Trending

Jackrong 发布了 Qwopus3.6-27B-Coder-Compat-MTP-GGUF,这是 Qwopus3.6-27B-Coder 模型的 GGUF 量化版本,并扩展了聊天模板,以提升与工具使用运行时及 OpenAI 兼容的代理框架的互操作性。

Jackrong/Qwopus3.6-27B-Coder-MTP-GGUF

Hugging Face Models Trending

GGUF量化版本的Qwopus3.6-27B-Coder-MTP模型已发布在Hugging Face上,针对本地推理进行了优化,兼容Transformers、vLLM、SGLang和Unsloth Studio。