只需合并Qwen3.6与3.8 27B即可以更少的token生成获得不错的性能
摘要
JetBrains 通过合并 Qwen3.6 和 Qwen3.8 27B 模型创建了一个非官方衍生版本,以在更少的 token 生成下实现不错的性能,并针对编码任务进行了优化。
查看缓存全文
缓存时间: 2026/09/28 13:57
JetBrains/Qwen3.8-3.6-27B-blend · Hugging Face
来源:https://huggingface.co/JetBrains/Qwen3.8-3.6-27B-blend
非官方JetBrains衍生版。 此模型由JetBrains基于阿里巴巴云开发的Qwen模型制作而成。本版本发布与阿里巴巴云或阿里巴巴集团无关,亦未获得其赞助或认可。
编码质量与输出token:在JetBrains内部100项任务的编码基准测试(https://blog.jetbrains.com/junie/2026/09/smarter-local-al/)中完成的任务
在JetBrains内部100项任务的编码基准测试中完成的任务与输出token的关系。不同配置的推理设置有所差异;具体方法和背景请参阅文章。
阅读《让本地AI更智能高效》(https://blog.jetbrains.com/junie/2026/09/smarter-local-al/)了解Junie Local的发布故事、编码评估、token效率结果以及MTP运行时实验。
可用格式:BF16 (https://huggingface.co/JetBrains/Qwen3.8-3.6-27B-blend) · GGUF (https://huggingface.co/JetBrains/Qwen3.8-3.6-27B-blend-GGUF) · MLX 4-bit (https://huggingface.co/JetBrains/Qwen3.8-3.6-27B-blend-MLX-4bit) · MTP MLX 4-bit (https://huggingface.co/JetBrains/Qwen3.8-3.6-27B-blend-MTP-MLX-4bit)。
此模型是Qwen3.6-27B和Qwen3.8-27B的50/50混合,通过线性插值其检查点参数创建而成。其配置、分词器、处理器和聊天模板均沿用自Qwen3.8-27B。确切的源版本修订和合并设置记录在merge-manifest.json中。
插值使用float32精度累加。
0.5 * Qwen/Qwen3.6-27B + 0.5 * Qwen/Qwen3.8-27B
Qwen/Qwen3.6-27B修订版6a9e13bd6fc8f0983b9b99948120bc37f49c13e9Qwen/Qwen3.8-27B修订版1d4bf0f2ff6012fd82039f2fa52739d0dd7c60c0
https://huggingface.co/JetBrains/Qwen3.8-3.6-27B-blend#license-and-attribution许可证与归属
本模型依据Apache License, Version 2.0(Apache开源许可协议第2.0版)分发。原始的Qwen许可证(包含Copyright 2026 Alibaba Cloud)保持不变。
版权所有 © 2026 JetBrains s.r.o.。此声明仅适用于由JetBrains贡献的原始材料。上游Qwen材料仍受其原始版权和归属声明约束。
请参阅NOTICE了解归属信息,以及CHANGES.md了解修改描述和受影响的文件。
https://huggingface.co/JetBrains/Qwen3.8-3.6-27B-blend#note-on-acceptable-use关于可接受使用
本模型依据Apache License, Version 2.0(Apache开源许可协议第2.0版)分发。此声明不修改该许可证。用户请注意,使用此模型或其输出侵犯第三方版权或其他知识产权,可能违反相关法律,且此行为独立于本许可条款。
https://huggingface.co/JetBrains/Qwen3.8-3.6-27B-blend#training-and-upstream-information训练与上游信息
创建此衍生版本未进行任何额外的训练或微调,也未使用额外的训练数据;其制作过程仅包含上述以及CHANGES.md中描述的检查点合并,以及在适用情况下的提取、格式转换和量化。
关于上游信息,请参阅官方的Qwen3.6-27B模型卡和Qwen3.8-27B模型卡。Qwen还发布了训练数据摘要,描述了为qwen.ai提供支持的模型的通用训练数据;它并未明确指出这两个检查点的具体训练数据集。
相似文章
Qwen 3.8 27B 比预期更快
一位用户报告称,Qwen 3.8 27B 模型在双 5060 TI 显卡上达到了 50-60 个令牌每秒的速度,显示出比之前版本(如 Qwen 3.6)更令人意外的速度提升。
Qwen 3.8 27b 即使在 Q3_xxs 下也很强大
用户发现 Qwen 3.8 27b 在 Q3 量化下对编码任务非常高效,推理速度快,超越了之前的模型,尽管在日常对话中存在一些小问题。
Qwen3.8-27B:更慢的词元,更快更好的结果
Qwen3.8-27B 是一款新型人工智能模型,强调实际运行时间而非词元生成速度,能在配备32GB显存的消费级硬件上本地部署,并提供卓越的智能表现。
我对比测试了 Qwen3.8 27B IQ3_XXS (10.18GiB) 和 Bonsai Ternary PQ2 (6.42GiB)
作者在有限的显存下比较了 Qwen3.8 27B IQ3_XXS 和 Bonsai Ternary PQ2 的性能,发现 Qwen 更快且使用的 token 更少,而 Bonsai 文件更小但生成时间更长。
对于拥有12GB GPU的用户,现在可以通过新的Ternary版本运行QWEN 3.6 27B,损失很小。
Qwen3.6 27B的新三元量化版本,名为Bonsai 27B,可以在12GB GPU上运行,内存需求减少10倍,性能达到原版的95%,使其适用于本地部署。