Jackrong/Qwopus3.6-35B-A3B-Coder-MTP-GGUF

Hugging Face Models Trending 模型

摘要

在 Hugging Face 上发布,Qwopus-3.6-35B-A3B-Coder 是一个经过微调的混合专家(MoE)编码代理模型,专为高效、低延迟的本地执行而设计,可在代理工作流中减少 token 浪费。

任务:图像到文本 标签:transformers, gguf, llama.cpp, image-text-to-text, vision, multimodal, text-generation-inference, unsloth, conversational, qwen3_6, moe, coder, agent, tool-use, function-calling, thinking-off, long-context, lora, sft, logic, math, en, zh, es, ru, ja, base_model:Jackrong/Qwopus3.6-35B-A3B-v1, base_model:adapter:Jackrong/Qwopus3.6-35B-A3B-v1, license:apache-2.0, endpoints_compatible, region:us
查看原文
查看缓存全文

缓存时间: 2026/07/01 23:34

Jackrong/Qwopus3.6-35B-A3B-Coder-MTP-GGUF · Hugging Face

来源:https://huggingface.co/Jackrong/Qwopus3.6-35B-A3B-Coder-MTP-GGUF

⚙️ Qwopus-3.6-35B-A3B-Coder

Agentic Coder 发布版

一款基于 Qwopus3.6-35B-A3B-v1 / Qwen3.6-35B-A3B 构建的、关闭思考、高效利用 token 的编码代理模型。

🧠 关闭思考代理⚡ 高效利用 token 的编码🛠️ 工具调用与工作流🧩 35B-A3B MoE🎮 游戏演示就绪

💡什么是 Qwopus-3.6-35B-A3B-Coder?

🪐 Qwopus-3.6-35B-A3B-Coder 是一次专注于执行效率的实用编码代理微调,而不是简单地追求更长的可见推理过程。它专为真实的代理式编码工作流而设计,其中模型需要反复读取文件、选择工具、编辑代码、运行测试、对错误做出反应并总结工作。核心目标是在禁用显式长思考的情况下,以更少的 token 浪费、更低的延迟和更稳定的行为完成更多此类步骤。

⚡ 快速代理循环专注于工具决策、补丁、测试运行和基于错误的调试,无需强制每一步都进入长思考模式。

🧩 MoE 效率基于 35B 总参数/3B 活跃参数的 MoE 基础架构,适用于高吞吐量的本地编码工作流。

🛠️ 代理框架适配旨在适配 Codex 风格、OpenHands 风格、Claude Code 风格和 OpenCode 风格的代理框架。

🎮 实时编码演示包含一个通过代理工作流生成的 RTS/游戏构建示例的展示位。

社区发布说明:Qwopus-3.6-35B-A3B-Coder 是一款实验性社区模型,旨在用于研究、本地编码代理评估和工作流探索。它尚未经过完整的安全评估或广泛的通用领域基准测试。

评估模式:本模型卡的核心设计目标和比较框架是关闭思考执行。评估该模型是否能在不依赖每一步长可见推理轨迹的情况下,保持有用性和稳定性。


https://huggingface.co/Jackrong/Qwopus3.6-35B-A3B-Coder-MTP-GGUF#%F0%9F%8E%AF-1-fine-tuning-objective-less-overthinking-more-execution🎯 1. 微调目标:少过度思考,多执行

🧭1.1 为何存在此模型

本次微调的目标并非为了追求更长的推理链本身。在真实的编码代理工作流中,许多步骤是操作性的,而非深度的哲学思考:读取文件、检查堆栈跟踪、选择下一个工具、编辑代码、运行测试、检查错误、继续执行并报告结果。

如果每一步都进入长思考模式,工作流可能会付出不必要的代价:更多的 token、更高的延迟、更嘈杂的状态转换,以及更大的长期行为漂移风险。Qwopus-3.6-35B-A3B-Coder 围绕不同的产品假设进行调优:

让模型用更少的 token、更快的回合和更稳定的工具行为完成更多的代理工作。

⚡1.2 核心优化目标

1. 更快的下一步决策识别何时需要检查、编辑、测试或总结,而无需过度斟酌。

2. 更少的 token 浪费在常规实现步骤中减少不必要的长篇推理。

3. 更好的工作流稳定性在文件编辑、工具调用和重试过程中,使多轮编码任务保持正轨。

4. 适合本地部署使高频编码任务在本地或自托管推理栈上更加实用。

🛠️1.3 目标工作流

此模型旨在很好地适配Codex / OpenHands / Claude Code / OpenCode 风格的代理框架、长时间运行的代码库编辑、自动调试、多轮工具调用、低延迟本地部署以及大型上下文代码库任务,在这些场景中,实用的执行质量比冗长的可见思考更重要。


https://huggingface.co/Jackrong/Qwopus3.6-35B-A3B-Coder-MTP-GGUF#%F0%9F%92%A1-2-base-model-training-stack–collaboration💡 2. 基础模型、训练栈与协作

🧠2.1 基础模型:Qwopus3.6-35B-A3B-v1 / Qwen3.6-35B-A3B

编码器模型基于 Qwopus3.6-35B-A3B 系列构建,而该系列本身基于 Qwen3.6-35B-A3B。底层架构是一种混合稀疏 MoE 模型,总参数为 35B,每个 token 约有 3B 活跃参数,使其对本地高频编码工作负载具有吸引力。

属性规格与详情🧩 架构混合稀疏 MoE,35B 总参数 / 每个 token 约 3B 活跃参数🏢 基础开发者阿里云 / Qwen 家族,通过 unsloth/Qwen3.6-35B-A3B🎯 编码器关注点代理式编码、工具使用稳定性、代码编辑、调试、多轮工作流执行⚡ 评估重点关闭思考执行、token 效率、更低延迟、跨长代理循环的稳定行为📄 上下文设计用于大型上下文的代码库工作;确切部署上下文取决于推理栈和配置

🧪2.2 硬件合作与联合协作

本项目与工程师 Kyle Hessling 密切合作构建,其硬件基础设施、训练支持及实时代理实验帮助在实际编码工作负载下验证模型。

👉 在 X/Twitter 上关注硬件和模型训练更新:@KyleHessling1 (https://x.com/KyleHessling1)

🦥2.3 微调框架:Unsloth

训练工作流通过 Unsloth 进行加速和内存优化。特别感谢 Unsloth 团队使高效的大型模型微调变得更加可及。


https://huggingface.co/Jackrong/Qwopus3.6-35B-A3B-Coder-MTP-GGUF#%F0%9F%93%8A-3-thinking-off-agentic-evaluation📊 3. 关闭思考的代理评估

📊 评估:Qwopus 3.6 35B 关闭思考 vs Ornith-1.0 35B 开启思考

比较 Qwopus(关闭思考)与 Ornith(开启思考)。本部分所有基准测试均使用 Q5_K_M / Q5KM 量化模型。分数越高越好。基准测试由 Tom Turney 提供,X 上为 @no_stp_on_snek。

主要发现在这些 Q5_K_M 量化评估中,Qwopus 3.6 35B关闭思考状态下进行测试。该模型还完成了一次包含 300 个案例的 SWE-bench 提交补丁运行,得分为 62.4%。在行为比较中,Qwopus 在实用执行类别中领先,例如合法请求遵守、压力下完整性、多轮编排、大型代码交付和持续调试。Ornith 在选定的推理导向维度上仍然更强,例如长上下文回忆、元认知、工程能力和上下文中毒抵抗。

🎞️

Kyle Hessling 的交互式模型演示Kyle 创建了一个简短的 Hugging Face Space 演示,以视觉方式介绍模型故事:关闭思考的代理编码、35B / 3B MoE 设置、MTP 辅助的本地推理、SWE-bench 结果、token 效率比较、Qwopus 关闭 vs Ornith 开启以及 OpenCode RTS 演示。

视觉解释器关闭思考工作流SWE-bench + RTS 演示

打开 Kyle 的交互式演示 → (https://huggingface.co/spaces/KyleHessling1/qwopus36-35b-a3b-coder-deck)

平均分数82.1 vs 78.9Qwopus vs Ornith

SWE-bench62.4%300 个案例,已提交补丁

🧪3.1 SWE-bench 提交补丁运行

结果: Qwopus-3.6-35B-A3B-Coder 在关闭思考提交补丁模式下,于300 个案例的 SWE-bench 运行中获得 62.4% 的分数。评估的模型是 Q5_K_M 量化构建。

基准测试SWE-bench

运行规模300 个任务

模式关闭思考

量化Q5_K_M

评估模型 / 量化补丁模式分数SWE-bench, 300 案例Qwopus-3.6-35B-A3B-Coder Q5_K_M关闭思考, 提交补丁62.4%

⚖️3.2 数值记分卡

注意: 分数是保留的行为 + 长视界编码评估结果,采用 0-100 分制。分数越高越好。比较有意将 Qwopus 的关闭思考模式与 Ornith-1.0 的开启思考模式进行对比。

能力领域Qwopus 3.6 35B 关闭思考Ornith-1.0 35B 开启思考观察模式合法请求遵守10070Qwopus 更可靠地遵循允许的用户意图。压力下完整性9386Qwopus 在对抗性或压力工作流条件下更稳定。多轮编排8070Qwopus 在长代理循环中更好地维护状态。大型代码交付7565Qwopus 在较大的代码工件上表现出更强的完成行为。持续调试6050Qwopus 在重复修复-测试周期中持有实际优势。长上下文回忆9095Ornith 在依赖思考的回忆密集型设置中保持小幅优势。元认知9095Ornith 受益于显式的开启思考反思。工程能力8194Ornith 在广泛的工程能力上仍然更强。上下文中毒抵抗7085Ornith 在此测试中对上下文中毒更鲁棒。

要点: Qwopus-3.6-35B-A3B-Coder 被定位为一种实用的代理执行模型。重要的结果不仅仅是它能否思考得更长,而是当工作流需要许多快速、具体的决策时,它能否持续正确地行动。这使得它对于本地编码代理、自动调试循环和大型代码库任务特别相关,在这些任务中,token 效率直接影响可用性。


https://huggingface.co/Jackrong/Qwopus3.6-35B-A3B-Coder-MTP-GGUF#%F0%9F%8E%AE-4-live-agent-demo-rts-game-sample🎮 4. 实时代理演示:RTS 游戏示例

🎮 OpenCode / 代理游戏构建演示

一个实际的视觉测试,用于检验模型是否能在代理工作流中规划、编码、迭代并交付一个交互式项目。

Kyle Hessling 在 OpenCode 工作流中测试了即将发布的 Qwopus-Coder-35B-A3B,要求它创建一个完整的 RTS 风格游戏示例。这类演示非常有用,因为它将代码生成、文件编排、UI/游戏逻辑、迭代修正和最终交付质量融合在一个可见的任务中。

Qwopus-3.6-35B-A3B-Coder RTS 游戏演示截图 (https://cdn-uploads.huggingface.co/production/uploads/66309bd090589b7c65950665/MiFWxkoAogtYtbxNRSogc.png)

为什么这很重要: 一个可玩的游戏演示并非正式的基准测试,但它是代理编码的一个高信号冒烟测试。它揭示了模型能否维护项目结构、生成连贯的状态逻辑,并完成一个视觉上可检查的成果,而不仅仅是回答孤立的提示。


https://huggingface.co/Jackrong/Qwopus3.6-35B-A3B-Coder-MTP-GGUF#%F0%9F%97%BA%EF%B8%8F-5-training–workflow-design🗺️ 5. 训练与工作流设计

本版本的训练和评估理念侧重于代理执行,而非可见的链长度。模型应该知道何时直接行动、何时检查更多上下文、何时停止并总结。

`` [ Qwopus-3.6-35B-A3B-Coder: Agentic Execution Pipeline ](代理执行管道)

Base MoE Foundation(基础 MoE 基座) Qwen3.6-35B-A3B / Qwopus3.6-35B-A3B-v1 │ ▼ Coding + Tool-Use Adaptation(编码 + 工具使用适配) 仓库任务、调试痕迹、工具架构、多轮反馈 │ ▼ Thinking-Off Behavior Target(关闭思考行为目标) 更快的下一步决策、更少过度思考、更低 token 浪费 │ ▼ Agent Harness Workflows(代理框架工作流) 读取文件 → 选择工具 → 编辑代码 → 运行测试 → 检查错误 → 迭代 → 报告 │ ▼ Final Objective(最终目标) 稳定的长视界代码执行,具备实际的本地延迟 ``

本模型卡有意将关闭思考行为框定为产品目标。长思考对于困难推理仍然有用,但此版本关注的是模型能否在不付出每一步成本的情况下完成真实的编码代理工作。


https://huggingface.co/Jackrong/Qwopus3.6-35B-A3B-Coder-MTP-GGUF#%E2%9C%85-6-recommended-use-cases–known-limits✅ 6. 推荐使用场景与已知限制

✅ 良好适配场景

Codex 风格的代理工作流、OpenHands/OpenCode 编码循环、仓库级调试、多文件补丁生成、自动化测试-修复循环、本地工具调用代理、DevOps 脚本、代码审查辅助以及大型上下文项目导航。

⚠️ 谨慎使用

作为一个专门的编码器模型,不应假定它在所有通用领域任务中都是最优的。工具调用质量强烈依赖于提示格式、模式一致性以及周围的框架。长思考在某些难度较高、速度不太重要的推理任务上可能仍有帮助。

部署说明:对于代理使用,请确保工具定义、系统提示、输出解析和重试行为保持一致。关闭思考的模型可能很快,但框架仍然需要清晰的模式、有用的错误反馈和严格的任务边界。


https://huggingface.co/Jackrong/Qwopus3.6-35B-A3B-Coder-MTP-GGUF#%F0%9F%93%9A-7-resources-acknowledgements–citation📚 7. 资源、致谢与引用

📚 资源与致谢

👉 GitHub 仓库:Jackrong-llm-finetuning-guide (https://github.com/R6410418/Jackrong-llm-finetuning-guide.git) 访问项目仓库和相关微调指南。

👉 Q5_K_M 基准测试评估 SWE-bench 提交补丁运行,以及行为 / 长视界编码评估。基准测试由 Tom Turney 提供,X 上为 @no_stp_on_snek

👉 Kyle Hessling 交互式模型演示 (https://huggingface.co/spaces/KyleHessling1/qwopus36-35b-a3b-coder-deck) 可视化 Hugging Face Space,解释模型故事、关闭思考工作流、SWE-bench 结果、token 效率和 RTS 演示。

👉 Kyle Hessling RTS 游戏演示帖子 (https://x.com/KyleHessling1/status/2070562997630873699) OpenCode / RTS 游戏构建示例的参考帖子。

👉 Unsloth 文档 (https://unsloth.ai/docs) 训练加速和内存高效微调资源。

致谢: 特别感谢 Qwen 团队提供的强大 Qwen3.6 MoE 基座模型、Unsloth 提供的高效微调工具、Kyle Hessling 的硬件协作和实时代理测试,以及构建代理编码生态系统的开源贡献者。

引用

@misc{jackrong_qwopus36_35b_a3b_coder, title = {Qwopus-3.6-35B-A3B-Coder}, author = {Jackrong}, year = {2026}, publisher = {Hugging Face}, howpublished = {\url{https://huggingface.co/Jackrong/Qwopus-3.6-35B-A3B-Coder}} }

上个月下载量12,635

Jackrong/Qwopus3.6-35B-A3B-Coder-MTP-GGUF 的模型树https://huggingface.co/docs/hub/model-cards#specifying-a-base-model

包含 Jackrong/Qwopus3.6-35B-A3B-Coder-MTP-GGUF 的合集

相似文章

Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF

Hugging Face Models Trending

Jackrong 发布了 Qwopus3.6-27B-Coder-Compat-MTP-GGUF,这是 Qwopus3.6-27B-Coder 模型的 GGUF 量化版本,并扩展了聊天模板,以提升与工具使用运行时及 OpenAI 兼容的代理框架的互操作性。

Jackrong/Qwopus3.6-27B-Coder-MTP-GGUF

Hugging Face Models Trending

GGUF量化版本的Qwopus3.6-27B-Coder-MTP模型已发布在Hugging Face上,针对本地推理进行了优化,兼容Transformers、vLLM、SGLang和Unsloth Studio。

Jackrong/Qwopus3.5-9B-Coder-MTP-GGUF

Hugging Face Models Trending

Jackrong 发布了 Qwopus3.5-9B-Coder-MTP-GGUF,这是一个基于 Qwen 的 9B 代码模型,采用多令牌预测 (MTP) 架构进行微调,相较于基模型实现了 35.8% 的吞吐量提升和 8.3% 的准确率提升,在代码和数学基准测试中取得满分。

Jackrong/Qwopus3.6-35B-A3B-v1-GGUF

Hugging Face Models Trending

Jackrong 发布 Qwopus3.6-35B-A3B-v1,基于阿里巴巴 Qwen3.6 MoE 模型的推理增强微调版本,针对逻辑推理和智能体编程优化,拥有 350 亿总参数和 30 亿激活参数。