unsloth/Qwen3.8-27B-NVFP4

Hugging Face Models Trending 模型

摘要

Unsloth 发布了 Qwen3.8-27B AI 模型的 NVFP4 量化版本,该模型在编码、专业工作、智能体任务和原生视觉语言理解方面提供了增强的能力。

标签:safetensors, qwen3_5, unsloth, base_model:Qwen/Qwen3.8-27B, base_model:quantized:Qwen/Qwen3.8-27B, license:apache-2.0, compressed-tensors, region:us
查看原文
查看缓存全文

缓存时间: 2026/08/15 09:28

unsloth/Qwen3.8-27B-NVFP4 · Hugging Face

来源:https://huggingface.co/unsloth/Qwen3.8-27B-NVFP4

https://huggingface.co/unsloth/Qwen3.8-27B-NVFP4#read-our-how-to-run-qwen38-27b-guide阅读我们的如何运行Qwen3.8-27B指南!(https://unsloth.ai/docs/models/qwen3.8)

此NVFP4量化版本使用Unsloth动态V3.0(预览版)以获得最先进的量化性能。

  • 支持开发者角色,使Qwen3.8可以在Codex等智能体工具中工作!
  • 支持MTP(多Token预测)以实现快速推理。
  • Qwen3.8现在可以在Unsloth桌面版中运行和微调(https://unsloth.ai/docs/new/desktop)。阅读我们的指南(https://unsloth.ai/docs/models/qwen3.8)。
  • 工具调用改进:优化了嵌套对象的解析,使工具调用成功率更高。
  • 请参阅下图,了解在Unsloth桌面版中运行的4位Qwen3.8-27B:

qwen3.8 unsloth desktop


继Qwen3.5和Qwen3.6系列被社区广泛采用之后,我们很高兴地推出Qwen3.8,这是迄今为止Qwen开放模型家族中能力最强的一代。

基于Qwen3.5的架构基础构建,Qwen3.8在编程、专业工作、研究和长期智能体任务方面带来了显著提升。Qwen3.8-27B将这些进步带入了一个紧凑、易于部署的稠密模型:一个原生的视觉-语言模型,理解图像和视频,具备灵活的思维控制,旨在以更高的可靠性完成复杂的多步骤任务。

https://huggingface.co/unsloth/Qwen3.8-27B-NVFP4#qwen38-highlightsQwen3.8 亮点

Qwen3.8-27B 具有以下增强特性:

  • 核心能力:在编码、专业工作、研究和长期智能体任务方面实现全面改进。
  • 智能体执行:更强的自主规划能力和对环境反馈的更好处理,从而实现更可靠的端到端任务完成。
  • 下游兼容性:更广泛地支持流行的框架和开发工具,使其更容易集成到您现有的技术栈中。
  • 灵活的思维控制:思维模式默认开启,可按请求禁用;可以通过 reasoning_effort 调节推理深度,并通过 preserve_thinking 从历史消息中保留推理上下文。
  • 视觉-语言理解:原生支持图像和视频理解,涵盖从STEM图表和文档到小时级视频。

https://huggingface.co/unsloth/Qwen3.8-27B-NVFP4#model-overview模型概览

  • 类型:带视觉编码器的因果语言模型
  • 训练阶段:预训练 & 后训练
  • 语言模型
    • 参数数量:270亿
    • 隐藏维度:5120
    • Token嵌入:248,320(已填充)
    • 层数:64
    • 隐藏层布局:16 × (3 × (门控DeltaNet → FFN) → 1 × (门控注意力 → FFN))
    • 门控DeltaNet:
      • 线性注意力头数:V为48,QK为16
      • 头维度:128
    • 门控注意力:
      • 注意力头数:Q为24,KV为4
      • 头维度:256
      • 旋转位置嵌入维度:64
    • 前馈网络:
      • 中间维度:17,408
    • 语言模型输出:248,320(已填充)
    • MTP(多Token预测):通过多个步骤进行训练
  • 上下文长度:原生支持262,144个Token,可扩展至最高1,000,000个Token。

https://huggingface.co/unsloth/Qwen3.8-27B-NVFP4#best-practices最佳实践

为获得最佳性能,我们推荐以下设置:

  1. 采样参数:我们建议使用以下采样参数组合:
    • 思维模式:temperature=1.0top_p=0.95top_k=20min_p=0.0presence_penalty=0.0repetition_penalty=1.0
    • 指令(或非思维)模式:temperature=0.7top_p=0.80top_k=20min_p=0.0presence_penalty=1.5repetition_penalty=1.0 对于支持的框架,您可以将 presence_penalty 参数在0到2之间调整以减少无尽重复。然而,使用较高的值偶尔可能导致语言混合和模型性能轻微下降。
  2. 充足的输出长度:为优化智能体任务的性能,我们建议分配足够的输出长度,以便模型生成详细且全面的响应。对于支持为内部推理和最终输出分别设置Token限制的框架,我们建议在100万上下文长度内进行如下配置:
    • 推理内容:将最大输出长度设置为262,144个Token。
    • 最终响应:将最大输出长度设置为131,072个Token。 这些设置为复杂推理提供了必要的容量,同时确保有充足的空间用于高质量的最终交付物。
  3. 处理超长文本:Qwen3.8-27B原生支持最高262,144个Token的上下文长度。对于总长度(包括输入和输出)超过此限制的长期任务,我们建议使用RoPE缩放技术来有效处理长文本,例如YaRN。
  4. 长视频理解:为了优化纯文本和图像的推理效率,已发布的 video_preprocessor_config.json 中的 size 参数是保守配置的。建议将 video_preprocessor_config 文件中的 longest_edge 参数设置为469,762,048(对应于224k视频Token),以便对小时级视频进行更高帧率的采样,从而获得更优的性能。例如:
    {"longest_edge": 469762048, "shortest_edge": 4096}
    

https://huggingface.co/unsloth/Qwen3.8-27B-NVFP4#citation引用

如果您觉得我们的工作有帮助,请随时引用我们。

@misc{qwen38,
    title = {{Qwen3.8-Max}: A New Bar for Coding and Cowork},
    url = {https://qwen.ai/blog?id=qwen3.8},
    author = {{Qwen Team}},
    month = {August},
    year = {2026}
}

上月下载量:90,924

unsloth/Qwen3.8-27B-NVFP4的模型树 https://huggingface.co/docs/hub/model-cards#specifying-a-base-model

包含unsloth/Qwen3.8-27B-NVFP4的合集

相似文章

unsloth/Qwen3.6-27B-GGUF

Hugging Face Models Trending

Unsloth 发布了 Qwen3.6-27B 模型的 GGUF 量化版本,具备更强的智能体编程能力、工具调用功能,并支持 Unsloth Studio。

unsloth/Qwen3.6-27B-NVFP4

Hugging Face Models Trending

Unsloth 发布了 Qwen3.6-27B 的 NVFP4 量化检查点,声称吞吐量提升 2.5 倍,精度与 FP8 和 BF16 相当,并提供了在 24GB GPU 上通过 vLLM 运行的说明。

unsloth/Qwen-AgentWorld-35B-A3B-GGUF

Hugging Face Models Trending

Unsloth 发布了 Qwen-AgentWorld-35B-A3B 的 GGUF 量化版本,这是一个原生语言世界模型,能够通过长链思维推理模拟七个领域(MCP、搜索、终端、SWE、Android、Web、操作系统)中的智能体环境,并通过 CPT、SFT 和 RL 进行训练。