@KyleHessling1: 大家好,再次见面!我们又有一个非常有趣的9b,这个专门为工具调用和智能体编码…
摘要
发布了名为Qwopus3.5-9B-Coder的新型9B微调模型,该模型针对工具调用和智能体编码工作流进行了优化,在SWE-bench和HermesAgent-20测试中取得了出色成绩,同时可在经济实惠的硬件上运行。
查看缓存全文
缓存时间: 2026/05/17 05:28
大家好!我们又带来了一款非常有趣的9B模型,这次是为@NousResearch Hermes agent中的工具调用和智能体编码工作流专门训练的。很高兴地报告,它的表现非常出色,而且作为9B模型,可以在非常实惠的硬件上运行。我们还对其进行了编码领域的专项训练,在200个样本的SWE基准测试子集中取得了53.33%的成绩!对我来说,看到这么小的模型在SWE上取得如此高的分数,我真的很震惊。如果我说错了请纠正我,但我认为这已经非常接近Gemma 4系列——这个特定基准上更大的模型——的成绩了,这真是不可思议!它还在HermesAgent-20基准测试中碾压了基础模型,得分85分,而基础模型只有71分!请务必使用高温运行,–temp大约为1,这似乎是这些特定微调模型在测试框架中的最佳点。如果遇到问题,可以适当调低,但高温(~1)运行时,它比基础模型表现好得多,不容易过度思考。请在Hermes中启动它,并告诉我们你的想法!一如既往地期待大家的反馈!另外,那些在等待Qwopus 3.6 27B的朋友们,我已经在我的HF仓库中为你们准备了初步评估,去看看吧;我们很快会发布完整模型!我会把初步评估的仓库链接放在评论区!— # Jackrong/Qwopus3.5-9B-Coder-GGUF · Hugging Face 来源:https://huggingface.co/Jackrong/Qwopus3.5-9B-Coder-GGUF ## https://huggingface.co/Jackrong/Qwopus3.5-9B-Coder-GGUF#%F0%9F%8C%9F-qwopus35-9b-coder🌟 Qwopus3.5-9B-coder ## https://huggingface.co/Jackrong/Qwopus3.5-9B-Coder-GGUF#%F0%9F%9A%80-model-fine-tuning-and-logical-alignment-qwopus35-9b-coder🚀 模型微调与逻辑对齐(Qwopus3.5-9B-coder) 作为本模型的基座模型,Qwopus3.5-9B-v3.5已经是一个能力强大的模型。在此基础上,Qwopus3.5-9B-coder针对高性能的**🤖 智能体编码、复杂工具调用和逻辑推理进行了专门的优化和微调。 > 💡为什么选择9B密集模型?我们相信9B密集架构代表了大型语言模型完美的“甜点”。它在入门级16GB RAM设备(如标准笔记本电脑和Mac mini)上可以流畅地以8位精度运行,非常轻量且用途广泛。无需昂贵的硬件,就能实现出色的性能和令人印象深刻的推理速度。简而言之,Qwen3.5-9B是目前同类中最好的开源模型。 图片 (https://cdn-uploads.huggingface.co/production/uploads/66309bd090589b7c65950665/8qFQVuCxbgkWqKa2B_Vph.jpeg) > 视觉与工具调用支持:此模型支持视觉能力和工具调用。如需启用视觉功能,请将GGUF仓库 (https://huggingface.co/Jackrong/Qwopus3.5-9B-coder-GGUF)中的mmproj\.gguf文件放置到主\.gguf文件的同一目录下。 — ### https://huggingface.co/Jackrong/Qwopus3.5-9B-Coder-GGUF#%F0%9F%9B%A0-training-strategy🛠 训练策略 本模型的微调过程深度融合了Trace Inversion数据增强技术和高质量的Agent Traces**。这种系统化的方法不仅增强了模型解决复杂编程任务的能力,还显著提高了其在使用各种工具时的逻辑连贯性和准确性。 本模型专门针对以下目标设计: - 🧩 更加结构化、更强的逻辑推理能力,减少重复思考 - 💻 在代码编写、调试和仓库级任务处理方面更强大的能力 - 🛠 更稳定、更准确的工具调用能力(终端命令、文件操作和浏览器) - 🔁 更好的跨数据源蒸馏对齐 > - 社区发布说明:Qwopus3.5-9B-coder纯粹作为实验性社区版本发布,旨在探索Agent能力与深度推理的结合,仅用于研究和探索用途。 > - 警告:由于此模型是针对编程agent和深度推理进行的垂直微调,并未经过全面的通用性能评估,其在通用领域或特定非编程任务上的能力可能会出现能力衰减。建议用户在探索其核心能力的同时,注意其其他场景下的局限性。 — ## https://huggingface.co/Jackrong/Qwopus3.5-9B-Coder-GGUF#%F0%9F%93%8A-baseline-performance-comparison📊 基准性能对比 为了验证Qwopus3.5-9B-coder在实际agent场景中的执行效率和逻辑稳健性,我们采用了开源测试框架benchlocal (https://github.com/stevibe/benchlocal)。 ### https://huggingface.co/Jackrong/Qwopus3.5-9B-Coder-GGUF#test-configuration测试配置 - 硬件环境:Apple Silicon (Mac) - 推理后端:LM Studio / MLX / GGUF - 测试平台:benchlocal (https://github.com/stevibe/benchlocal)——一个专注于本地模型agent能力的评估套件。 - 🍎 你可以看到不同模型格式在同一设备上的实际推理速度。 ### https://huggingface.co/Jackrong/Qwopus3.5-9B-Coder-GGUF#%F0%9F%A7%AA-benchmark-results🧪 基准结果 1. 复杂Agent性能 - HermesAgent-20 以下是在HermesAgent-20任务集上的对比表现: HermesAgent-20 性能指标模型测试集综合得分核心维度(M/O/S/S/B)Qwopus3.5-9B-coder (https://huggingface.co/Jackrong/Qwopus3.5-9B-coder-GGUF)HermesAgent-208584 / 93 / 88 / 75 / 84Qwen/Qwen3.5-9B (https://huggingface.co/Qwen/Qwen3.5-9B)HermesAgent-207175 / 58 / 100 / 53 / 69armand0e/Qwen3.5-9B-Agent (https://huggingface.co/armand0e/Qwen3.5-9B-Agent)HermesAgent-206871 / 83 / 43 / 61 / 80DJLougen/Harmonic-Hermes-9B (https://huggingface.co/DJLougen/Harmonic-Hermes-9B)HermesAgent-204760 / 45 / 23 / 69 / 382. 工具调用稳定性 - ToolCall-15 这是针对工具调用稳定性的ToolCall-15测试集,旨在测试模型在工具调用中的稳定性: ToolCall-15 稳定性指标模型测试集综合得分维度得分(A/B/C/D/E)Qwopus3.5-9B-coder (https://huggingface.co/Jackrong/Qwopus3.5-9B-coder-GGUF)ToolCall-15100100 / 100 / 100 / 100 / 100Qwen/Qwen3.5-9B (https://huggingface.co/Qwen/Qwen3.5-9B)ToolCall-15100100 / 100 / 100 / 100 / 100armand0e/Qwen3.5-9B-Agent (https://huggingface.co/armand0e/Qwen3.5-9B-Agent)ToolCall-1593100 / 100 / 100 / 67 / 1003. 代码调试与错误修复 - BugFind-15 BugFind-15是一个包含15个从浅到深场景的测试集,旨在通过确定性环境运行时验证,评估模型在发现和修复多种编程语言中的语法错误、逻辑错误及“陷阱”代码方面的真实调试能力。 BugFind-15 性能指标模型测试集综合得分维度得分(A/B/C/D/E)Qwopus3.5-9B-coder (https://huggingface.co/Jackrong/Qwopus3.5-9B-coder-GGUF)BugFind-157967 / 87 / 100 / 77 / 43Jackrong/MLX-Qwen3.5-9B-DeepSeek-V4-Flash (https://huggingface.co/Jackrong/MLX-Qwen3.5-9B-DeepSeek-V4-Flash-8bit)BugFind-157567 / 100 / 67 / 57 / 80armand0e/Qwen3.5-9B-Agent (https://huggingface.co/armand0e/Qwen3.5-9B-Agent)BugFind-155829 / 87 / 73 / 20 / 67### https://huggingface.co/Jackrong/Qwopus3.5-9B-Coder-GGUF#%F0%9F%AA%90-swe-bench-verified-performance-repository-level-coding-capability🪐 SWE-bench Verified 性能(仓库级编码能力) 以下是SWE-bench Verified上的对比表现,该基准评估语言模型解决真实世界开源仓库中软件工程问题的能力: SWE-bench Verified 性能指标模型测试集综合得分(%)Claude 4.5 OpusSWE-bench Verified80.9Qwen/Qwen3.5-27B (https://huggingface.co/Qwen/Qwen3.5-27B)SWE-bench Verified75.0Qwen/Qwen3.6-35B-A3B (https://huggingface.co/Qwen/Qwen3.6-35B-A3B)SWE-bench Verified73.4Qwopus3.5-9B-coder (https://huggingface.co/Jackrong/Qwopus3.5-9B-coder-GGUF)SWE-bench Verified53.33google/gemma-4-31B-it (https://huggingface.co/google/gemma-4-31B-it)SWE-bench Verified52.0google/gemma-4-26B-A4BSWE-bench Verified45.0 - 48.0> - ⚙️ 所有测试温度均设为1,这是qwen3.5官方推荐的设置。所有错误和模型问题在测试失败后会尝试重新生成两次。如果两次尝试都失败,则视为失败。 - 🍎 所有测试界面的截图都已上传到仓库的image文件夹中。点击下方链接查看和验证: - 🔗查看测试截图 (https://huggingface.co/Jackrong/Qwopus3.5-9B-coder/tree/main/test_images) - ❤️ 感谢Kyle Hessling的慷慨硬件和设备支持。你可以在X / Twitter上关注他获取更多更新:@KyleHessling1 (https://x.com/KyleHessling1)。 — ### https://huggingface.co/Jackrong/Qwopus3.5-9B-Coder-GGUF#%F0%9F%A7%AA-core-dataset-usage-trace-inversion-and-high-quality-agent-traces🧪 核心数据集使用:Trace Inversion 与高质量 Agent Traces 为了打破模型在实际编程和工具使用中的“推理泡沫”限制,并赋予其真正的Agent行为能力,本模型在训练中引入了核心增强数据集: #### https://huggingface.co/Jackrong/Qwopus3.5-9B-Coder-GGUF#1-reasoning-synthetic-data-combining-trace-inversion1. 结合Trace Inversion的推理合成数据 目前,根据公开信息,OpenAI的GPT系列和Anthropic的Claude系列等商业模型已经非常清晰地隐藏了其真实的内部推理链。对于这些模型,我们最终在API或前端界面中看到的往往只能被视为高度压缩的“推理泡沫”。 为了突破这一限制,我们采用了Trace Inversion技术。该技术利用外部“代理模型”,基于商业模型发布的“问题+最终答案+压缩推理摘要”来重建完整且逻辑连贯的深度推理链。原本仅由几句话和逻辑跳跃构成的“推理泡沫”,被扩展成了包含完整推导、计算和逻辑验证的高质量深度学习轨迹,为模型提供了逐步的逻辑学习信号。 a_high_resolution_infographic_slide_style_figure (https://cdn-uploads.huggingface.co/production/uploads/66309bd090589b7c65950665/Jo2bm_rUJQmfK3Na4Uja2.png) #### https://huggingface.co/Jackrong/Qwopus3.5-9B-Coder-GGUF#2-glm-51-agent-real-trace-data-lambdahermes-agent-reasoning-traces2. GLM-5.1 Agent真实轨迹数据: lambda/hermes-agent-reasoning-traces 为了显著增强模型在真实环境中的执行和编码能力,本模型额外引入了**lambda/hermes-agent-reasoning-traces数据集。 Screenshot 2026-05-16 at 5.34.59 PM (https://cdn-uploads.huggingface.co/production/uploads/66309bd090589b7c65950665/BTusWFqYaOS5GmRYvBuPq.png) - 数据来源与规模: 该数据子集包含约10,000条基于智谱GLM-5.1和kimi-4.6模型生成的高质量多轮工具调用轨迹。 - 真实Agent行为: 与传统的合成数据不同,这些样本代表了真实的Agent对话。每个样本不仅包含<reasoning>标签内的逐步推理过程,还包含了实际工具执行结果(而非凭空捏造的输出)。 - 广泛领域覆盖: - 终端与编码: 脚本编写、代码调试、环境配置和数据处理。 - 仓库任务: 涉及真实代码仓库的工作,如错误修复、重构和代码审查。 - 浏览器自动化: 网页导航、数据抓取和表单填写。 - Agent工具: 记忆持久化、任务委派、技能管理等。 通过学习这些包含真实反馈和思考过程的Agent轨迹,Qwopus3.5-9B-coder在面对复杂编程和系统操作任务时,能够展现出更接近人类专家的思维和操作模式。 — ## https://huggingface.co/Jackrong/Qwopus3.5-9B-Coder-GGUF#%F0%9F%97%BA%EF%B8%8F-training-pipeline-overview🗺️ 训练流程概览 本模型的训练整合了Trace Inversion数据增强技术和高质量Agent轨迹数据**的分阶段学习流程。其核心逻辑在于将商业模型高度压缩的“推理泡沫”恢复为可供学习的深度路径,并结合真实的Agent操作轨迹,全面提升模型的逻辑推理和代码执行能力。 [ 🗺️ Trace Inversion: 数据反转与"攻击"蒸馏的完整流程 ] A. 代理模型训练 开源模型 (GLM-5.1 / DS-V4) ──► 完整推理链 ──► [ Qwen3-235B 压缩 ] ──► 推理泡沫 │ │ └──────────► [ 训练 ] ◄─────────┘ (基座: Qwen3-4B-Instruct) (结果: Trace-Inverter-4B) B. 反转阶段: "攻击" Claude-4.7-Max _______________________________________________________ | | | Claude-4.7-Max API ──► 压缩泡沫 + 最终答案 | |_______________________________________________________| │ ▼ [ 🧠 Trace-Inverter-4B (逻辑重构器) ] ────► 合成 CoT │ ▼ [ 🧩 数据拼接 ] ◄────────── (原始提示 + 响应) (将反转的思维链嵌入 <reasoning> 标签,并与原始问答对拼接恢复) │ ▼ (结果: claude-opus-4.6/4.7 反转集) C. 最终 SFT 流程 ___________________________________________ | | | 基座模型 (Qwopus3.5-9B-v3.5) | |___________________________________________| │ ▼ [ 📦 阶段 1: 格式建立与逻辑注入 ] ───────► [ 🛠️ 阶段 2: Agent轨迹与编程强化 ] (整合反转推理数据,稳定思维格式) (引入 GLM-5.1 Agent轨迹,强化交互与执行) │ │ │ ▼ │ __________________________________________________ │ | 🔍 Hermes Agent 轨迹样本结构解析 (GLM-5.1) | │ | 1. [🛠️ 系统] -> JSON 工具定义 | │ | 2. [👤 人类] -> 初始任务指令 | │ | ┌──────────────────────────────────────────────┐ | │ | │ 🔁 多轮循环: │ | │ | │ 3. [🧠 GPT] -> 逻辑推理/反思 │ | │ | │ 4. [🤖 GPT] -> 工具调用执行动作 │ | │ | │ 5. [⚙️ 工具] -> 真实反馈 │ | │ | └──────────────────────────────────────────────┘ | │ |__________________________________________________| │ │ └────────────────┬────────────────┘ ▼ ___________________________________ | | | 🌟 最终模型: Qwopus3.5-9B-coder | |___________________________________| > 由于agent轨迹数据集复杂多样。数据集经过了严格的清洗和格式化。 ## https://huggingface.co/Jackrong/Qwopus3.5-9B-Coder-GGUF#%F0%9F%8E%AF-three-stage-curriculum-learning🎯 三阶段课程学习 Qwopus3.5-9B-coder采用了类似于课程学习的分阶段推理数据混合策略,逐步增加训练信号的难度和复杂度: 1. 早期阶段(格式建立): 侧重于格式稳定的短至中等长度推理样本。该阶段的主要目标是建立可靠、结构化的新推理格式,同时避免因极端复杂性而压垮模型。 2. 中期阶段(复杂度缩放与多教师蒸馏): 逐步增加来自多个教师模型的复杂推理样本的比例。 - 蒸馏数据来源于更强模型,其风格分布与基座模型接近,确保
相似文章
@KyleHessling1:大家早上好!Qwopus-3.6-35B-A3B-MTP-Coder 已上线!所有 GGUF 将在接下来几小时内填充!这是一个…
Qwopus-3.6-35B-A3B-MTP-Coder 是一个新的开源 MoE 微调模型,针对禁用思考过程的编码智能体工作流进行了优化,提供快速且高效的推理,与同类模型相比具有竞争力的性能。
@KyleHessling1: Qwopus Coder 在这里领跑!就连我旧的18B frankenmerge 在这个评测中也稳居第四,超越了许多更新更大的模型……
一条推文讨论了基准测试结果,其中 Qwopus Coder 位居榜首,而 Cohere 的 North-Mini-Code-1.0 在代理工具调用排行榜上垫底,显示出小模型的惊人结果。
@rasbt: 疯狂模型!它实际上使用了旧的Qwen2.5-Coder-3B栈,并通过后训练取得了非常出色的性能……
一个使用Qwen2.5-Coder-3B栈的3B参数模型,在编程基准测试中取得了与Claude Opus 4.5相媲美的分数,采用了详细的后训练技术,包括合成数据、过滤、两阶段SFT,以及一种新颖的RL方法(MGPO)。
Jackrong/Qwopus3.5-9B-Coder-MTP-GGUF
Jackrong 发布了 Qwopus3.5-9B-Coder-MTP-GGUF,这是一个基于 Qwen 的 9B 代码模型,采用多令牌预测 (MTP) 架构进行微调,相较于基模型实现了 35.8% 的吞吐量提升和 8.3% 的准确率提升,在代码和数学基准测试中取得满分。
Qwen3.6-35B-A3B 和 9B 已正式登上公开的 Terminal-Bench 2.0 排行榜!
Qwen3.6-35B-A3B 和 Qwen3.5-9B 模型已正式登上 Terminal-Bench 2.0 排行榜,其中 little-coder 在 35B 变体上取得 24.6% 的成绩,超越了 Gemini 2.5 Pro 和 Qwen3-Coder-480B;而 9B 模型则表明,10B 以下的本地模型能够与高难度代理基准竞争。