@KyleHessling1:大家早上好!Qwopus-3.6-35B-A3B-MTP-Coder 已上线!所有 GGUF 将在接下来几小时内填充!这是一个…

X AI KOLs Timeline 模型

摘要

Qwopus-3.6-35B-A3B-MTP-Coder 是一个新的开源 MoE 微调模型,针对禁用思考过程的编码智能体工作流进行了优化,提供快速且高效的推理,与同类模型相比具有竞争力的性能。

大家早上好! Qwopus-3.6-35B-A3B-MTP-Coder 已上线!所有 GGUF 格式将在接下来几小时内填充! 它是一个采用编码器训练方案的闪电般快速的 MoE。与 27B 编码器类似,它在禁用思考时表现出色,在处理时间上显著更快,同时获得与同尺寸的带思考模型相似甚至在某些情况下更好的结果!禁用思考后,它与新的 Ornith 35B MoE 在一系列广泛评估(由 @no_stp_on_snek 执行)中不相上下,在编码任务上略有优势,在速度和成本上更是显著胜出,尽管 Ornith 在运行中启用了思考。 完整测试结果请查看模型卡,并感谢 Tom (@no_stp_on_snek) 在发布前为我们全面评估了这个模型! 由于 MTP 和禁用思考,再加上 MoE 的速度,它在 @opencode 这样的集成环境中运行得如此之快,几乎感觉是即时的——在我的 5090 上达到了 253 tps。 不再需要等待 8k 个思考 token 后才能得到连贯输出。这在长上下文场景中尤其有用,因为基础模型会逐渐开始进行数万 token 的思考才回复。 与禁用思考的基础模型相比,编码器训练方案真正推动了无思考的前沿,尤其是在创造性方面。像往常一样调高温度,0.85-1,并确保你的集成环境在运行时不会覆盖服务器的温度设置。 如果你想充分发挥它的能力,我建议给它提供非常详尽的提示。我在 opencode 中使用它,它通过详细的提示自主生成的结果让我惊叹不已。请查看演示链接中的 Aether Dominion(RTS 游戏)和模型关于自身制作的一份幻灯片演示,结果非常漂亮,链接见下方评论! 我在这个极快的本地模型(禁用思考)上得到的结果,是一年前在一些前沿思考模型上都得不到的。 开源正在快速发展,鉴于最近的事件,现在正是优化你本地 AI 工作流的最佳时机。这个 MoE 是值得尝试的,如果你显存不多,它也是绝佳选择,因为即使部分卸载到系统内存也能快速运行! 总而言之,请关闭思考运行它,并构建你想看到的东西。我们非常期待看到你的成果以及对特定用例的反馈,请在下方评论! 另外,非常感谢 5000 名关注者,你们组成了一个如此愉快且知识渊博的开源社区,能够与你们所有人合作并讨论这项研究,我感到无比幸运。我无法表达对每一条评论的感激之情。和往常一样,我会尽力回复所有的评论! 如果有一天我们在 X 上实现变现,我会把每一分钱都投入到为实验室购买更多硬件上! 祝你们幸福,朋友们,期待你们的想法!
查看原文
查看缓存全文

缓存时间: 2026/06/29 22:32

大家早上好!

Qwopus-3.6-35B-A3B-MTP-Coder 现已发布!所有 GGUF 文件将在未来几小时内陆续上传!

这是一款基于编码器课程策略的闪电般快速的 MOE 模型。与 27B 编码器类似,它在禁用思考时表现亮眼,能以显著更快的实际执行时间获得与同尺寸思考模型相似甚至更优的结果!在禁用思考的情况下,它在广泛的评估套件中(由 @no_stp_on_snek 执行)与新的 Ornith 35B MoE 正面交锋,在编码轨迹上略胜一筹,并在速度和成本上具有决定性优势,尽管 Ornith 是启用思考运行的。

请参阅模型卡片获取完整的测试结果,并感谢 Tom(@no_stp_on_snek)在发布前为我们进行的全面评估。

配合 MTP 且禁用思考,加上 MOE 的速度,它在 @opencode 等工具中运行时速度极快,在我的 5090 上近乎瞬时,达到 253 tps。

无需等待 8000 个 tokens 的思考就能输出连贯结果。这在长上下文中尤其有用,基础模型在回复前会逐渐开始思考数万个 tokens。

与禁用思考的基础模型相比,编码器课程策略确实推进了无思考的前沿。尤其是在创造力方面。像往常一样使用较高温度,0.85-1,并确保你的工具在运行时不会覆盖服务器的温度设置。

如果你想充分利用它的能力,我建议你提供非常详尽的提示词。我一直在 opencode 中使用它,它通过大量提示词自主生成的结果让我惊叹不已。请查看演示的 Aether Dominion(RTS 游戏)以及模型生成的关于它自己的幻灯片演示文稿的链接,效果非常出色,链接见下方评论!

我在这个(禁用思考的)超快本地模型上获得了在一年多前某些前沿思考模型上都未能得到的结果。

开源正在快速发展,考虑到近期的一些事件,现在正是优化你本地 AI 工作流的最佳时机。这款 MOE 模型非常适合上手体验,如果你 VRAM 不多,它也是一个很好的选择,因为它可以部分卸载到系统内存快速运行!

话虽如此,请尝试在禁用思考的情况下运行它,并构建一些你感兴趣的东西。我们很期待看到你的成果以及下方评论中关于特定用例的任何反馈!

另外,非常感谢 5000 名关注者,你们组成了一个如此令人愉快且知识渊博的开源社区,我非常幸运能够与你们所有人合作并讨论这项研究。我无法用言语表达我对每一条评论的感激之情。像往常一样,我会努力回复所有评论!

如果将来在 X 上能够变现,我会把每一分钱都投入到为我们的实验室购买更多硬件上!

祝各位朋友们度过愉快的一天,期待你们的想法!


Jackrong/Qwopus3.6-35B-A3B-Coder-MTP-GGUF · Hugging Face

来源:https://huggingface.co/Jackrong/Qwopus3.6-35B-A3B-Coder-MTP-GGUF

⚙️ Qwopus-3.6-35B-A3B-Coder

智能体编码版本发布

一个禁用思考、令牌高效的编码智能体模型,基于 Qwopus3.6-35B-A3B-v1 / Qwen3.6-35B-A3B 构建。

🧠 禁用思考的智能体⚡ 令牌高效编码🛠️ 工具调用与工作流🧩 35B-A3B MoE🎮 游戏演示就绪

💡什么是 Qwopus-3.6-35B-A3B-Coder?

🪐 Qwopus-3.6-35B-A3B-Coder 是一个实用的编码智能体微调模型,专注于执行效率,而非仅仅更长的可见推理。它专为真实的智能体编码工作流设计,在这些工作流中,模型需要反复读取文件、选择工具、编辑代码、运行测试、对错误做出反应并总结工作。核心目标是在禁用显式长思考时,用更少的令牌浪费、更低的延迟和更稳定的行为来完成更多此类步骤。

⚡ 快速智能体循环:针对重复的工具决策、补丁、测试运行和基于错误的调试进行优化,无需强制每个步骤都进入长思考模式。

🧩 MoE 效率:基于 35B 总参数量/3B 活跃参数量的 MoE 基础构建,适用于高吞吐量的本地编码工作流。

🛠️ 适配智能体工具:旨在适配 Codex 风格、OpenHands 风格、Claude Code 风格和 OpenCode 风格的智能体工具。

🎮 实时编码演示:包含一个通过智能体工作流生成的 RTS/游戏构建示例的插槽。

社区发布说明:Qwopus-3.6-35B-A3B-Coder 是一个实验性社区模型,旨在用于研究、本地编码智能体评估和工作流探索。它尚未经过完整的安全评估或广泛的通用领域基准测试。

评估模式:此卡片的核心设计目标和比较框架是禁用思考的执行。评估模型是否能在不依赖每一步长可见推理轨迹的情况下保持有用和稳定。


🎯 1. 微调目标:少思多行

🧭 1.1 为何存在此模型

此微调的目标不是为了追求更长的推理链本身。在真实的编码智能体工作流中,许多步骤是操作性的,而非深度思辨性的:读取文件、检查堆栈跟踪、选择下一个工具、编辑代码、运行测试、检查错误、继续、报告结果。

如果每一步都进入长思考模式,工作流将付出不必要的成本:更多令牌、更高延迟、更嘈杂的状态转换,以及更大的长周期行为漂移风险。Qwopus-3.6-35B-A3B-Coder 围绕一个不同的产品假设进行调整:

让模型用更少的令牌、更快的轮次和更稳定的工具行为完成更多的智能体工作。

⚡ 1.2 核心优化目标

1. 更快的下一步决策:识别是需要检查、编辑、测试还是总结,无需过多斟酌。

2. 更少的令牌浪费:在常规实现步骤中减少不必要的长格式推理。

3. 更好的工作流稳定性:在跨文件编辑、工具调用和重试的多轮编码任务中保持正轨。

4. 适配本地部署:使高频编码任务在本地或自托管推理栈上更具实用性。

🛠️ 1.3 目标工作流

此模型旨在完美适配 Codex / OpenHands / Claude Code / OpenCode 风格的智能体工具、长期运行的仓库编辑、自动化调试、多轮工具调用、低延迟本地部署以及那些实用执行质量比冗长可见思考更重要的大上下文代码库任务。


💡 2. 基础模型、训练栈与合作

🧠 2.1 基础模型:Qwopus3.6-35B-A3B-v1 / Qwen3.6-35B-A3B

该编码器模型建立在 Qwopus3.6-35B-A3B 系列之上,而该系列本身基于 Qwen3.6-35B-A3B。底层架构是一个混合稀疏 MoE 模型,总参数量为 35B,每个令牌大约有 3B 活跃参数,使其对本地高频编码工作负载具有吸引力。

属性规格与详情
🧩 架构混合稀疏 MoE,35B 总参数 / 每个令牌约 3B 活跃参数
🏢 基础开发者阿里巴巴云 / Qwen 系列,通过 unsloth/Qwen3.6-35B-A3B
🎯 编码器重点智能体编码、工具使用稳定性、代码编辑、调试、多轮工作流执行
⚡ 评估重点禁用思考执行、令牌效率、更低延迟、跨长智能体循环的稳定行为
📄 上下文专为大上下文仓库工作设计;确切部署上下文取决于推理栈和配置

🧪 2.2 硬件合作与联合协作

本项目与工程师 Kyle Hessling 紧密合作构建,他的硬件基础设施、训练支持和实时智能体实验有助于在实际编码工作负载下验证模型。

👉 关注硬件和模型训练更新,请访问 X / Twitter:@KyleHessling1 (https://x.com/KyleHessling1)

🦥 2.3 微调框架:Unsloth

训练工作流通过 Unsloth 实现了加速和内存优化。特别感谢 Unsloth 团队使高效的大模型微调变得更加便捷。


📊 3. 禁用思考的智能体评估

📊 评估:Qwopus 3.6 35B 禁用思考 vs Ornith-1.0 35B 启用思考

这是 Qwopus(禁用思考)与 Ornith(启用思考)的对比。本节中所有基准测试均使用 Q5_K_M / Q5KM 量化模型。数值越高越好。基准测试由 Tom Turney (@no_stp_on_snek on X) 提供。

主要发现:在这些 Q5_K_M 量化评估中,Qwopus 3.6 35B禁用思考状态下进行测试。该模型还在一个 300 例 SWE-bench 提交补丁运行中获得了 62.4% 的分数。在行为比较中,Qwopus 在实用执行类别(如合法请求合规性、压力下完整性、多轮编排、大型代码交付和持续性调试)中领先。Ornith 在选定的推理导向维度(如长上下文召回、元认知、工程能力和上下文中毒抵抗)上仍然更强。

🎞️

Kyle Hessling 制作的互动模型演示:Kyle 创建了一个简短的 Hugging Face Space 演示,以视觉方式展示模型故事:禁用思考的智能体编码、35B / 3B MoE 设置、MTP 辅助本地推理、SWE-bench 结果、令牌效率比较、Qwopus 关闭思考 vs Ornith 开启思考,以及 OpenCode RTS 演示。

  • 视觉讲解器
  • 禁用思考工作流
  • SWE-bench + RTS 演示

打开 Kyle 的互动演示 → (https://huggingface.co/spaces/KyleHessling1/qwopus36-35b-a3b-coder-deck)

平均分82.1 vs 78.9Qwopus vs Ornith
SWE-bench62.4%300 例,已提交补丁

🧪 3.1 SWE-bench 已提交补丁运行

结果: Qwopus-3.6-35B-A3B-Coder 在禁用思考提交补丁模式下,于 300 例 SWE-bench 运行中获得了 62.4% 的分数。评估的模型是 Q5_K_M 量化版本。

基准测试SWE-bench
运行规模300 个任务
模式禁用思考
量化方式Q5_K_M
评估模型/量化补丁模式分数
Qwopus-3.6-35B-A3B-Coder Q5_K_M禁用思考,已提交补丁62.4%

⚖️ 3.2 数值评分卡

注意: 分数是保留的行为 + 长周期编码评估结果,采用 0-100 分制。分数越高越好。该对比有意将 Qwopus(禁用思考模式)与 Ornith-1.0(启用思考模式)进行对比。

能力领域Qwopus 3.6 35B
禁用思考
Ornith-1.0 35B
启用思考
观察到的模式
合法请求合规性10070Qwopus 更可靠地遵循允许的用户意图。
压力下完整性9386Qwopus 在对抗性或高压工作流条件下更稳定。
多轮编排8070Qwopus 在长智能体循环中能更好地保持状态。
大型代码交付7565Qwopus 对大型代码工件的完成行为更强。
持续性调试6050Qwopus 在重复的修复-测试周期中保持实际优势。
长上下文召回9095Ornith 在重召回的启用思考设置中保持微弱优势。
元认知9095Ornith 受益于显式的启用思考反思。
工程能力8194Ornith 在广泛的工程能力上仍然更强。
上下文中毒抵抗7085在此测试中,Ornith 对上下文中毒的鲁棒性更强。

关键结论: Qwopus-3.6-35B-A3B-Coder 被定位为一个实用的智能体执行模型。重要的结果不仅仅是它能否思考更久,而是在工作流需要大量快速、具体决策时,它能否继续正确行动。这使得它对于本地编码智能体、自动化调试循环以及令牌效率直接影响可用性的大规模代码库任务尤其相关。


🎮 4. 实时智能体演示:RTS 游戏示例

🎮 OpenCode / 智能体游戏构建演示

一个实用的视觉测试,检验模型能否在智能体工作流中进行规划、编码、迭代并交付一个交互式项目。

Kyle Hessling 在 OpenCode 工作流中测试了即将发布的 Qwopus-Coder-35B-A3B,要求它创建一个完整的 RTS 风格游戏示例。这种演示很有用,因为它将代码生成、文件编排、UI/游戏逻辑、迭代修正和最终交付质量结合在一个可见的任务中。

Qwopus-3.6-35B-A3B-Coder RTS 游戏演示截图 (https://cdn-uploads.huggingface.co/production/uploads/66309bd090589b7c65950665/MiFWxkoAogtYtbxNRSogc.png)

为何这很重要: 一个可玩的游戏演示不是一个正式的基准测试,但它是一个高信号量的智能体编码冒烟测试。它能揭示模型是否能够维护项目结构、生成连贯的状态逻辑,并完成一个可视化的可检查工件,而不仅仅是回答孤立的提示词。


🗺️ 5. 训练与工作流设计

本次发布的训练和评估理念集中于智能体执行,而非可见的链条长度。模型应该知道何时直接行动、何时检查更多上下文、以及何时停止并总结。

[ Qwopus-3.6-35B-A3B-Coder: 智能体执行流水线 ]

  基础 MoE 基础
  Qwen3.6-35B-A3B / Qwopus3.6-35B-A3B-v1
          │
          ▼
  编码 + 工具使用适配
  仓库任务、调试痕迹、工具架构、多轮反馈
          │
          ▼
  禁用思考行为目标
  更快的下一步决策、减少过度思考、降低令牌浪费
          │
          ▼
  智能体工具工作流
  读取文件 → 选择工具 → 编辑代码 → 运行测试 → 检查错误 → 迭代 → 报告
          │
          ▼
  最终目标
  具有实际本地延迟的稳定长周期代码执行

此模型卡特意将禁用思考行为框定为产品目标。对于困难的推理,长思考仍然可能有用,但本次发布侧重于模型能否在不每一步都付出此代价的情况下完成真实的编码智能体工作。


✅ 6. 推荐用例与已知限制

✅ 适合

Codex 风格的智能体工作流、OpenHands/OpenCode 编码循环、仓库级别的调试、多文件补丁生成、自动化测试-修复周期、本地工具调用智能体、DevOps 脚本编写、代码审查协助以及大型上下文项目导航。

⚠️ 谨慎使用

作为一个专门的编码器模型,不应假定它对于所有通用领域任务都是最优的。工具调用质量在很大程度上取决于提示格式、架构一致性以及周围的工具环境。在速度不那么重要的某些高难度推理任务上,长思考可能仍然有帮助。

部署说明:对于智能体使用,请确保工具定义、系统提示、输出解析和重试行为保持一致。禁用思考的模型可能很快,但工具环境仍然需要清晰的架构、有用的错误反馈和严格的任务边界。


📚 7. 资源、致谢与引用

📚 资源与致谢

👉 GitHub 仓库:Jackrong-llm-finetuning-guide (https://github.com/R6410418/Jackrong-llm-finetuning-guide.git) 访问项目仓库和相关的微调指南。

👉 Q5_K_M 基准评估 SWE-bench 已提交补丁运行以及行为 / 长周期编码评估。基准测试由 Tom Turney (@no_stp_on_snek) 提供。

相似文章

Jackrong/Qwopus3.6-35B-A3B-Coder-MTP-GGUF

Hugging Face Models Trending

在 Hugging Face 上发布,Qwopus-3.6-35B-A3B-Coder 是一个经过微调的混合专家(MoE)编码代理模型,专为高效、低延迟的本地执行而设计,可在代理工作流中减少 token 浪费。

Jackrong/Qwopus3.6-27B-Coder-MTP-GGUF

Hugging Face Models Trending

GGUF量化版本的Qwopus3.6-27B-Coder-MTP模型已发布在Hugging Face上,针对本地推理进行了优化,兼容Transformers、vLLM、SGLang和Unsloth Studio。