unsloth/Qwen3.8-27B-NVFP4
摘要
Unsloth 发布了 Qwen3.8-27B AI 模型的 NVFP4 量化版本,该模型在编码、专业工作、智能体任务和原生视觉语言理解方面提供了增强的能力。
查看缓存全文
缓存时间: 2026/08/15 09:28
unsloth/Qwen3.8-27B-NVFP4 · Hugging Face
来源:https://huggingface.co/unsloth/Qwen3.8-27B-NVFP4
https://huggingface.co/unsloth/Qwen3.8-27B-NVFP4#read-our-how-to-run-qwen38-27b-guide阅读我们的如何运行Qwen3.8-27B指南!(https://unsloth.ai/docs/models/qwen3.8)
此NVFP4量化版本使用Unsloth动态V3.0(预览版)以获得最先进的量化性能。
- 支持开发者角色,使Qwen3.8可以在Codex等智能体工具中工作!
- 支持MTP(多Token预测)以实现快速推理。
- Qwen3.8现在可以在Unsloth桌面版中运行和微调(https://unsloth.ai/docs/new/desktop)。阅读我们的指南(https://unsloth.ai/docs/models/qwen3.8)。
- 工具调用改进:优化了嵌套对象的解析,使工具调用成功率更高。
- 请参阅下图,了解在Unsloth桌面版中运行的4位Qwen3.8-27B:
qwen3.8 unsloth desktop
继Qwen3.5和Qwen3.6系列被社区广泛采用之后,我们很高兴地推出Qwen3.8,这是迄今为止Qwen开放模型家族中能力最强的一代。
基于Qwen3.5的架构基础构建,Qwen3.8在编程、专业工作、研究和长期智能体任务方面带来了显著提升。Qwen3.8-27B将这些进步带入了一个紧凑、易于部署的稠密模型:一个原生的视觉-语言模型,理解图像和视频,具备灵活的思维控制,旨在以更高的可靠性完成复杂的多步骤任务。
https://huggingface.co/unsloth/Qwen3.8-27B-NVFP4#qwen38-highlightsQwen3.8 亮点
Qwen3.8-27B 具有以下增强特性:
- 核心能力:在编码、专业工作、研究和长期智能体任务方面实现全面改进。
- 智能体执行:更强的自主规划能力和对环境反馈的更好处理,从而实现更可靠的端到端任务完成。
- 下游兼容性:更广泛地支持流行的框架和开发工具,使其更容易集成到您现有的技术栈中。
- 灵活的思维控制:思维模式默认开启,可按请求禁用;可以通过
reasoning_effort调节推理深度,并通过preserve_thinking从历史消息中保留推理上下文。 - 视觉-语言理解:原生支持图像和视频理解,涵盖从STEM图表和文档到小时级视频。
https://huggingface.co/unsloth/Qwen3.8-27B-NVFP4#model-overview模型概览
- 类型:带视觉编码器的因果语言模型
- 训练阶段:预训练 & 后训练
- 语言模型
- 参数数量:270亿
- 隐藏维度:5120
- Token嵌入:248,320(已填充)
- 层数:64
- 隐藏层布局:16 × (3 × (门控DeltaNet → FFN) → 1 × (门控注意力 → FFN))
- 门控DeltaNet:
- 线性注意力头数:V为48,QK为16
- 头维度:128
- 门控注意力:
- 注意力头数:Q为24,KV为4
- 头维度:256
- 旋转位置嵌入维度:64
- 前馈网络:
- 中间维度:17,408
- 语言模型输出:248,320(已填充)
- MTP(多Token预测):通过多个步骤进行训练
- 上下文长度:原生支持262,144个Token,可扩展至最高1,000,000个Token。
https://huggingface.co/unsloth/Qwen3.8-27B-NVFP4#best-practices最佳实践
为获得最佳性能,我们推荐以下设置:
- 采样参数:我们建议使用以下采样参数组合:
- 思维模式:
temperature=1.0,top_p=0.95,top_k=20,min_p=0.0,presence_penalty=0.0,repetition_penalty=1.0 - 指令(或非思维)模式:
temperature=0.7,top_p=0.80,top_k=20,min_p=0.0,presence_penalty=1.5,repetition_penalty=1.0对于支持的框架,您可以将presence_penalty参数在0到2之间调整以减少无尽重复。然而,使用较高的值偶尔可能导致语言混合和模型性能轻微下降。
- 思维模式:
- 充足的输出长度:为优化智能体任务的性能,我们建议分配足够的输出长度,以便模型生成详细且全面的响应。对于支持为内部推理和最终输出分别设置Token限制的框架,我们建议在100万上下文长度内进行如下配置:
- 推理内容:将最大输出长度设置为262,144个Token。
- 最终响应:将最大输出长度设置为131,072个Token。 这些设置为复杂推理提供了必要的容量,同时确保有充足的空间用于高质量的最终交付物。
- 处理超长文本:Qwen3.8-27B原生支持最高262,144个Token的上下文长度。对于总长度(包括输入和输出)超过此限制的长期任务,我们建议使用RoPE缩放技术来有效处理长文本,例如YaRN。
- 长视频理解:为了优化纯文本和图像的推理效率,已发布的
video_preprocessor_config.json中的size参数是保守配置的。建议将video_preprocessor_config文件中的longest_edge参数设置为469,762,048(对应于224k视频Token),以便对小时级视频进行更高帧率的采样,从而获得更优的性能。例如:{"longest_edge": 469762048, "shortest_edge": 4096}
https://huggingface.co/unsloth/Qwen3.8-27B-NVFP4#citation引用
如果您觉得我们的工作有帮助,请随时引用我们。
@misc{qwen38,
title = {{Qwen3.8-Max}: A New Bar for Coding and Cowork},
url = {https://qwen.ai/blog?id=qwen3.8},
author = {{Qwen Team}},
month = {August},
year = {2026}
}
上月下载量:90,924
unsloth/Qwen3.8-27B-NVFP4的模型树 https://huggingface.co/docs/hub/model-cards#specifying-a-base-model
包含unsloth/Qwen3.8-27B-NVFP4的合集
相似文章
unsloth/Qwen3.6-27B-GGUF
Unsloth 发布了 Qwen3.6-27B 模型的 GGUF 量化版本,具备更强的智能体编程能力、工具调用功能,并支持 Unsloth Studio。
unsloth/Qwen3.6-27B-NVFP4
Unsloth 发布了 Qwen3.6-27B 的 NVFP4 量化检查点,声称吞吐量提升 2.5 倍,精度与 FP8 和 BF16 相当,并提供了在 24GB GPU 上通过 vLLM 运行的说明。
2.5倍更快的Qwen3.6 NVFP4 Unsloth量化版本
Unsloth推出使用NVFP4格式的量化Qwen3.6模型,推理速度提升2.5倍。
unsloth/Qwen-AgentWorld-35B-A3B-GGUF
Unsloth 发布了 Qwen-AgentWorld-35B-A3B 的 GGUF 量化版本,这是一个原生语言世界模型,能够通过长链思维推理模拟七个领域(MCP、搜索、终端、SWE、Android、Web、操作系统)中的智能体环境,并通过 CPT、SFT 和 RL 进行训练。
@mr_r0b0t: 叫上兄弟们,新的 @UnslothAI NVFP4 刚刚发布
Unsloth AI 发布了新的 NVFP4 量化 Qwen3.6 模型,在 GPU 上运行速度提升 2.5 倍,并提高了准确性和工具调用能力。