标签
用户评测显示,Qwen 3.8 27b 在房地产和金融领域的专业资格考试中表现卓越,借助工具和引导式搜索,得分高达98.44%。
Qwen Lab 发布了 Qwen 3.8 27B,与之前的版本如 Qwen 3.6 27B 和其他开源模型相比,有显著提升。作者希望 Qwen 发表论文,以帮助其他实验室开发类似的高质量小型模型。
Unsloth的Daniel Han验证了Qwen3.8-27B仅需17GB显存即可运行,使其能够用于本地推理。
一位开发者构建了一个测试框架,在量化过程中测量每个权重组的 KL 散度,从而生成了 Qwen3.6-27B 的三个定制量化版本(Bedrock、Tightrope、Gambit),实现了优化的压缩。工具调用被确定为量化下最早退化的能力。
DavidAU 发布了 Qwen3.6-27B-Fable-Fusion-711,这是一个对 Qwen 3.6 27B 进行多阶段微调的模型,声称在 ARC-C 基准测试中超过 700 分,超越了基础模型并匹敌闭源模型,提供 GGUF 格式,适用于消费级硬件。
DFlash 是一种方法,可将 Qwen3.6 27B 模型推理速度提升2.2倍,且质量无损失。
用户在 RTX 3090 上测试了三元量化版本的 Qwen3.6 27B,使用两个槽位和 100k KV 缓存,占用 21GB 显存,达到了 60 tk/s 的速度,质量良好且工具调用稳定。
在 RTX 5090 上运行 Qwen3.6 27B,调整 MTP 和缓存设置后达到每秒 6.4k 个 token,展示了推理优化技术。
Prism ML 发布了 Ternary-Bonsai-27B-mlx-2bit,这是一个三元量化的 27B 参数语言模型,在约 7.2 GB 内存下实现了 FP16 性能的约 95%,使笔记本电脑能够进行完整推理。
一条推广Qwen 3.6 27b模型并推荐UnslothAI在任何GPU上运行它的推文。
Hugging Face 仓库 (kaitchup/Qwen3.6-27B-GGUF-MoQ) 提供了 Qwen3.6-27B MoQ 模型的 GGUF 量化权重,支持使用 llama.cpp 和 Ollama 等工具进行本地推理。
GGUF量化版本的Qwopus3.6-27B-Coder-MTP模型已发布在Hugging Face上,针对本地推理进行了优化,兼容Transformers、vLLM、SGLang和Unsloth Studio。
MooreThreads 发布了 MusaCoder-27B,一个拥有 270 亿参数的代码生成模型,并随附 arXiv 论文。
用户分享了对 Qwen3.6 27B 模型的体验,该模型一次性成功生成了一个完整的 HTML5 打砖块游戏,展现了令人印象深刻的连贯性和对细节的关注,超越了典型的 LLM 输出。
Qwen 3.6 27B 在16 GB VRAM上运行快速,得益于'Pure Quant'技术,通过MTP达到40 tokens/s,并支持64k上下文,使得本地AI能在RTX 4060 Ti等消费级GPU上运行。