Jackrong/Qwopus3.5-9B-Coder-MTP-GGUF
摘要
Jackrong 发布了 Qwopus3.5-9B-Coder-MTP-GGUF,这是一个基于 Qwen 的 9B 代码模型,采用多令牌预测 (MTP) 架构进行微调,相较于基模型实现了 35.8% 的吞吐量提升和 8.3% 的准确率提升,在代码和数学基准测试中取得满分。
任务: text-generation
标签: transformers, gguf, text-generation-inference, unsloth, qwen3_5, reasoning, chain-of-thought, mtp, multi-token-prediction, speculative-decoding, lora, sft, agent, coder, text-generation, en, zh, ko, ru, ja, es, 数据集:Jackrong/Claude-opus-4.7-TraceInversion-5000x, 数据集:Jackrong/Claude-opus-4.6-TraceInversion-9000x, 基模型:Jackrong/Qwopus3.5-9B-v3.5, 基模型适配器:Jackrong/Qwopus3.5-9B-v3.5, 许可证:apache-2.0, endpoints_compatible, 区域:us, conversational
查看缓存全文
缓存时间: 2026/05/22 19:45
Jackrong/Qwopus3.5-9B-Coder-MTP-GGUF · Hugging Face 来源: https://huggingface.co/Jackrong/Qwopus3.5-9B-Coder-MTP-GGUF ## https://huggingface.co/Jackrong/Qwopus3.5-9B-Coder-MTP-GGUF#%F0%9F%8C%9F-qwopus35-9b-coder-mtp-multi-token-prediction🌟 Qwopus3.5-9B-Coder-MTP(多令牌预测) ## https://huggingface.co/Jackrong/Qwopus3.5-9B-Coder-MTP-GGUF#%F0%9F%92%A1-multi-token-prediction-mtp-architecture-overview💡 多令牌预测(MTP)架构概述 > 什么是MTP(多令牌预测)? MTP是近年来大型语言模型(LLM)训练与推理领域的一项革命性技术。与传统的自回归模型(每次只预测单个令牌,即单令牌预测)不同,MTP模型在训练时被设计为在每个位置同时预测多个未来令牌。这种架构带来了两个核心维度的变革: 1. 更深的表示与规划:它迫使模型在表示层面为更长期的上下文进行全局规划(长程规划)。这增强了在复杂编码、多步骤数学推理等逻辑密集型任务中的认知一致性,同时有效缓解了传统自回归模型中常见的“推理气泡”和重复循环问题。 2. 极致的推理加速(推测解码):在推理过程中,模型配备了额外的轻量级辅助预测头(草稿头,本模型中配置为draft=2)。当主干网络生成当前令牌时,草稿头以可忽略的计算开销并行预测后续2个候选令牌,然后由主模型通过一次前向传播进行验证。验证成功后,模型可以在单次推理步骤中输出多个令牌,从而带来显著的吞吐量提升。 ## https://huggingface.co/Jackrong/Qwopus3.5-9B-Coder-MTP-GGUF#%F0%9F%9A%80-performance-briefing-base-vs-mtp-draft2🚀 性能简报:Base vs MTP(draft=2) 基于在逻辑/编码/DevOps/数学/边缘(5个核心领域,30个复杂评估问题)上的实际测试,Qwopus3.5-9B-Coder-MTP(draft=2) 在速度和正确性上均表现出绝对优势: - ⚡ 速度跃升:整体吞吐率从4.94 T/s跃升至6.71 T/s(吞吐量提升+35.8%),总延迟节省16.4分钟(总时间减少25%)。 - 🎯 准确性与鲁棒性:整体准确率从80.0% 提升至88.3%(+8.3个百分点)。该模型在编码(100%准确率) 和数学(100%准确率) 这两个高难度任务场景中取得了满分,彻底消除了Base模型中观察到的代码截断和重复行为(与模型类型无关)。 - 📊 整体效率指数:在权衡正确性与推理时间后,MTP模型的整体推理效率提升了38.4%。 > 评估配置和基准框架遵循Unsloth团队对Qwen系列的官方测试,其研究表明设置draft=2可获得最佳性能。完整详情参见官方Unsloth MTP基准测试 (https://unsloth.ai/docs/models/qwen3.6#mtp-benchmarks)。 — ## https://huggingface.co/Jackrong/Qwopus3.5-9B-Coder-MTP-GGUF#%E2%9A%99%EF%B8%8F-test-environment–configuration⚙️ 测试环境与配置 为保证评估的严谨性、客观性和可复现性,本基准测试在统一的硬件平台和采样超参数下进行: - 🖥️ 计算平台:GB10专用服务器平台(配备高性能LLM计算加速芯片,提供丰富的并行计算能力)。 - ⚙️ 并发配置:采用并发数=5进行多线程并发压力与稳定性测试,真实模拟实际多用户并发调用场景。 - 🛠️ 脚本版本:Benchlocal Test Suite v1.3.0推理评估脚本。 - 🧪 采样超参数:- 温度 (Temperature):1.0(推荐标准值,平衡逻辑推理与创造力)。 - Top-p:0.95(保留高概率候选,过滤尾部噪声,确保推理准确性)。 — ## https://huggingface.co/Jackrong/Qwopus3.5-9B-Coder-MTP-GGUF#1-token-volume-and-speed-statistics1. 令牌量与速度统计 每个问题的令牌与速度详情问题ID类别Base T/sBase时间Base令牌数MTP T/sMTP时间MTP令牌数加速比Q1逻辑4.2086.803656.1086.455271.00xQ2逻辑4.40178.707865.80130.807591.37xQ3逻辑4.30172.667436.8090.246141.91xQ4逻辑4.20153.056437.9067.855362.25xQ5逻辑4.20172.337246.7040.882744.22xQ6编码4.40240.9610606.70160.3210741.50xQ7编码4.30244.0710506.20173.2610741.41xQ8编码4.30245.0510546.80158.9210811.54xQ9编码4.30245.4610556.60162.9510751.51xQ10编码4.40241.5910636.20173.4410751.39xQ11编码4.20249.5510486.90156.0910771.60xQ12编码4.20211.458886.50155.9810141.36xQ13编码4.30248.0910676.50164.9110721.50xQ14编码4.10156.126406.30119.727541.30xQ15编码4.30144.476216.40165.9710620.87x逻辑类别(Q1-Q5)答案验证问题ID问题摘要正确答案BaseMTPQ1有17只羊,死了9只,还剩几只9只羊PASSPASSQ2旅馆谜题:30美元,缺失的1美元在哪里没有损失,会计错误PASSPASSQ3数列:2, 6, 12, 20, 30, ?42(n * (n+1))PASSPASSQ4球棒+球=1.10美元,球棒比球贵1美元0.05美元PASSPASSQ5乘以3,加6,除以3,减去原数结果永远为2PASSPASS> 逻辑:Base 5/5 = 100% | MTP 5/5 = 100% 编码类别(Q6-Q15)答案验证问题ID问题摘要BaseMTP解释Q6Python斐波那契生成器PARTIALPASSBase重复=True,代码截断存在逻辑问题Q7Python线程安全单例PARTIALPASSBase重复=True,实现不完整Q8按第二列降序排序CSVPARTIALPASSBase代码截断Q9Python HTTP服务器PASSPASS两者均完整实现Q10Python执行时间装饰器PASSPASS两者均完整实现Q11C++二叉搜索树PASSPASS两者均完整实现Q12Bash备份脚本(含日期)PASSPASS两者均完整实现Q13Python拓扑排序PASSPASS两者均完整实现Q14Node.js DockerfilePASSPASS两者均完整实现Q15SQL第二高薪水PASSPASS两者均正确实现> 编码:Base 7/10 = 70% | MTP 10/10 = 100% DevOps类别(Q16-Q20)答案验证问题ID问题摘要BaseMTP解释Q16Nginx反向代理和负载均衡PARTIALPARTIAL两者配置框架正确但响应被截断Q17硬链接与软链接PARTIALPASSBase重复=True,存在重复行;MTP完整Q18crontab每周二凌晨3:15执行PASSPASS两者均正确:15 3 * * 2 script.shQ19SSH服务器安全配置PARTIALPARTIAL两者内容均被截断Q20systemd服务失败后重启PASSPASS两者解释均正确> DevOps:Base 2.5/5 = 50% | MTP 3.5/5 = 70% 数学类别(Q21-Q25)答案验证问题ID问题摘要正确答案BaseMTPQ21求f(x) = x^3 * ln(x)的导数x^2 * (3ln(x) + 1)PASSPASSQ22解方程组:2x+y=5, x-y=1x=2, y=1PASSPASSQ23掷两个骰子点数和为7的概率1/6 ≈ 16.67%PASSPASSQ24求e^(2x)的积分(1/2)e^(2x)+CPASSPASSQ25证明前n个奇数之和为n^2归纳法/等差数列PARTIALPASS> 数学:Base 4.5/5 = 90% | MTP 5/5 = 100% 边缘类别(Q26-Q30)答案验证问题ID问题摘要BaseMTP解释Q26输出’Apple’5次PASSPASS两者均正确输出5行Q27输出某短语3次PASSPASS两者均正确Q28解释无穷(含禁用词约束)PASSPARTIALMTP重复=True,响应被截断Q29生成5层嵌套JSONPASSPARTIALMTP最后一项不完整,Base生成了6层Q30对30个’A’回复’B B B’PASSPASS两者均正确> 边缘:Base 5/5 = 100% | MTP 3/5 = 60% — 整体准确率总结类别问题数Base正确数Base准确率MTP正确数MTP准确率逻辑55100%5100%编码10770%10100%DevOps52.550%3.570%数学54.590%5100%边缘55100%360%总计302480.0%26.588.3% — 推理效率比较效率指标Base模型MTP模型MTP优势整体吞吐率 (T/s)4.946.71+35.8%整体准确率80.0%88.3%+8.3pp总延迟81.3 min64.9 min节省16.4min推理效率指数 (准确率/延迟)1.64e-42.27e-4+38.4%每1k令牌正确回答数0.995 Q/kT1.014 Q/kT+1.9% — 质量问题统计质量问题Base计数MTP计数重复(重复输出标志)2次 (Q6, Q17)2次 (Q6, Q28)超时0次0次响应不完整/截断~8次~4次过长推理链较少较多 — ## https://huggingface.co/Jackrong/Qwopus3.5-9B-Coder-MTP-GGUF#8-final-conclusion8. 最终结论 ### https://huggingface.co/Jackrong/Qwopus3.5-9B-Coder-MTP-GGUF#areas-where-mtp-model-excelsMTP模型擅长领域 - 速度:整体提升35.8%,在数学和边缘任务中尤为突出。 - 编码:100%完整代码输出,而Base因重复出现了3次截断。 - 数学:100%准确率,推理链条更系统。 - 效率:整体推理效率指数高出38.4%。 ### https://huggingface.co/Jackrong/Qwopus3.5-9B-Coder-MTP-GGUF#areas-for-mtp-model-improvementMTP模型改进方向 - 边缘任务稳定性:Q28/Q29出现过长的推理链导致令牌限制截断。 - DevOps长文本:对于较长的解释性回复,草稿匹配率低,导致加速效果有限。 推荐场景场景推荐模型代码生成MTP数学推理MTP逻辑推理两者均可短文本指令(边缘)Base更稳定DevOps长文档两者都需要更大的max_tokens — ## https://huggingface.co/Jackrong/Qwopus3.5-9B-Coder-MTP-GGUF#%F0%9F%8C%9F-qwopus35-9b-coder🌟 Qwopus3.5-9B-coder ## https://huggingface.co/Jackrong/Qwopus3.5-9B-Coder-MTP-GGUF#%F0%9F%9A%80-model-fine-tuning-and-logical-alignment-qwopus35-9b-coder🚀 模型微调与逻辑对齐(Qwopus3.5-9B-coder) 作为本模型的基础模型,Qwopus3.5-9B-v3.5本身已具备强大能力。在此基础上,Qwopus3.5-9B-coder针对高性能的**🤖 智能体编码、复杂工具调用和逻辑推理进行了专门优化和微调。 > 💡为什么选择9B稠密模型? 我们相信9B稠密架构代表了大型语言模型的完美“甜点”。它在入门级16GB RAM设备(如标准笔记本电脑和Mac mini)上以8位精度无缝运行,极为轻量且功能强大。无需昂贵的硬件,即可实现出色的性能和快速的推理速度。简而言之,Qwen3.5-9B目前是同类中最好的开源模型。 image (https://cdn-uploads.huggingface.co/production/uploads/66309bd090589b7c65950665/8qFQVuCxbgkWqKa2B_Vph.jpeg) > 视觉与工具调用支持:本模型支持视觉能力和工具调用。要启用视觉功能,请将GGUF仓库 (https://huggingface.co/Jackrong/Qwopus3.5-9B-coder-GGUF) 中的mmproj.gguf文件放置在与主.gguf文件相同的目录下。 — ### https://huggingface.co/Jackrong/Qwopus3.5-9B-Coder-MTP-GGUF#%F0%9F%9B%A0-training-strategy🛠 训练策略 本模型的微调过程深度融合了Trace Inversion数据增强技术和高质量Agent Traces**。这种系统方法不仅增强了模型解决复杂编程任务的能力,还大大提高了其在使用各种工具时的逻辑连贯性和准确性。 本模型专为实现以下目标而设计: - 🧩 更结构化、更强的逻辑推理能力,减少重复思考 - 💻 更强的代码编写、调试和仓库级任务处理能力 - 🛠 更稳定、更准确的工具调用能力,适用于终端命令、文件操作和浏览器 - 🔁 更好的跨数据源蒸馏对齐 > - 社区发布声明:Qwopus3.5-9B-coder纯粹作为实验性社区版本发布,旨在探索智能体能力与深度推理的结合,仅用于研究和探索。 - 警告:由于该模型针对编程智能体和深度推理进行了垂直微调,且未经过全面的通用性能评估,其在通用领域或特定的非编程任务上可能出现能力衰减。建议用户在探索其核心能力的同时,注意其在其他场景中的局限性。 — ## https://huggingface.co/Jackrong/Qwopus3.5-9B-Coder-MTP-GGUF#%F0%9F%93%8A-baseline-performance-comparison📊 基准性能对比 为了验证Qwopus3.5-9B-coder在实际智能体场景中的执行效率和逻辑鲁棒性,我们采用了开源测试框架benchlocal (https://github.com/stevibe/benchlocal)。 ### https://huggingface.co/Jackrong/Qwopus3.5-9B-Coder-MTP-GGUF#test-configuration测试配置 - 硬件环境:Apple Silicon (Mac) - 推理后端:LM Studio / MLX / GGUF - 测试平台:benchlocal (https://github.com/stevibe/benchlocal) - 专注于本地模型智能体能力的评估套件。 - 🍎 您可以在同一设备上看到不同模型格式的实际推理速度。 ### https://huggingface.co/Jackrong/Qwopus3.5-9B-Coder-MTP-GGUF#%F0%9F%A7%AA-benchmark-results🧪 基准测试结果 1. 复杂智能体性能 - HermesAgent-20 以下是在HermesAgent-20任务集上的对比性能: HermesAgent-20 性能指标模型测试集综合得分核心维度 (M/O/S/S/B)**Qwopus3.5-9B-coder (https://huggingface.co/Jackrong/Qwopus3.5-9B-coder-GGUF)**HermesAgent-208584 / 93 / 88 / 75 / 84Qwen/Qwen3.5-9B (https://huggingface.co/Qwen/Qwen3.5-9B)HermesAgent-207175 / 58 / 100 / 53 / 69armand0e/Qwen3.5-9B-Agent (https://huggingface.co/armand0e/Qwen3.5-9B-Agent)HermesAgent-206871 / 83 / 43 / 61 / 80DJLougen/Harmonic-Hermes-9B (https://huggingface.co/DJLougen/Harmonic-Hermes-9B)HermesAgent-204760 / 45 / 23 / 69 / 382. 工具调用稳定性 - ToolCall-15 这是针对工具调用稳定性的ToolCall-15测试集,旨在测试模型在工具调用中的稳定性: ToolCall-15 稳定性指标模型测试集综合得分维度得分 (A/B/C/D/E)**Qwopus3.5-9B-coder (https://huggingface.co/Jackrong/Qwopus3.5-9B-coder-GGUF)**ToolCall-15100100 / 100 / 100 / 100 / 100Qwen/Qwen3.5-9B (https://huggingface.co/Qwen/Qwen3.5-9B)ToolCall-15100100 / 100 / 100 / 100 / 100armand0e/Qwen3.5-9B-Agent (https://huggingface.co/armand0e/Qwen3.5-9B-Agent)ToolCall-1593100 / 100 / 100 / 67 / 1003. 代码调试与错误修复 - BugFind-15 BugFind-15是一个包含15个由浅入深场景的测试集,旨在通过确定性环境运行时验证,评估模型在发现和修复多种编程语言中的语法、逻辑错误以及“陷阱”代码方面的真实调试能力。 BugFind-15 性能指标模型测试集综合得分维度得分 (A/B/C/D/E)**Qwopus3.5-9B-coder (https://huggingface.co/Jackrong/Qwopus3.5-9B-coder-GGUF)**BugFind-157967 / 87 / 100 / 77 / 43Jackrong/MLX-Qwen3.5-9B-DeepSeek-V4
相似文章
Jackrong/Qwopus3.6-35B-A3B-Coder-MTP-GGUF
在 Hugging Face 上发布,Qwopus-3.6-35B-A3B-Coder 是一个经过微调的混合专家(MoE)编码代理模型,专为高效、低延迟的本地执行而设计,可在代理工作流中减少 token 浪费。
Jackrong/Qwopus3.6-27B-Coder-MTP-GGUF
GGUF量化版本的Qwopus3.6-27B-Coder-MTP模型已发布在Hugging Face上,针对本地推理进行了优化,兼容Transformers、vLLM、SGLang和Unsloth Studio。
Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF
Jackrong 发布了 Qwopus3.6-27B-Coder-Compat-MTP-GGUF,这是 Qwopus3.6-27B-Coder 模型的 GGUF 量化版本,并扩展了聊天模板,以提升与工具使用运行时及 OpenAI 兼容的代理框架的互操作性。
Jackrong/Qwopus3.6-35B-A3B-v1-GGUF
Jackrong 发布 Qwopus3.6-35B-A3B-v1,基于阿里巴巴 Qwen3.6 MoE 模型的推理增强微调版本,针对逻辑推理和智能体编程优化,拥有 350 亿总参数和 30 亿激活参数。
Jackrong/Qwopus3.6-27B-v2-MTP-GGUF
Jackrong/Qwopus3.6-27B-v2-MTP-GGUF 是 27B 参数语言模型的 GGUF 量化版本,托管在 Hugging Face 上,并附有使用各种库和工具的说明。