@TheAhmadOsman: 顺便说一下,Qwen 3.8 27B 的 NVFP4 版本可以在单个 RTX 5090 上运行。

X AI KOLs Following 模型

摘要

Qwen 3.8 27B 模型已推出 NVFP4 量化版本,使其能在单个 RTX 5090 GPU 上运行,并在编码、智能任务和视觉语言理解方面有所增强。

Qwen 3.8 27B 的 NVFP4 版本可以在单个 RTX 5090 上运行,顺便提一下。 https://t.co/3lTp9EPJQR
查看原文
查看缓存全文

缓存时间: 2026/08/15 13:58

顺便说一下,Qwen 3.8 27B 的 NVFP4 版本可以装进单张 RTX 5090 显卡

https://t.co/3lTp9EPJQR


unsloth/Qwen3.8-27B-NVFP4 · Hugging Face

来源:https://huggingface.co/unsloth/Qwen3.8-27B-NVFP4

https://huggingface.co/unsloth/Qwen3.8-27B-NVFP4#read-our-how-to-run-qwen38-27b-guide阅读我们的《如何运行 Qwen3.8-27B》指南!(https://unsloth.ai/docs/models/qwen3.8)

此 NVFP4 量化版采用 Unsloth Dynamic V3.0(预览版),实现了最先进的量化性能。

  • 支持开发者角色,使 Qwen3.8 能在 Codex 等智能体工具中运行!
  • 支持 MTP 加速推理。
  • Qwen3.8 现在可以在 Unsloth Desktop (https://unsloth.ai/docs/new/desktop) 中运行和微调。阅读我们的指南 (https://unsloth.ai/docs/models/qwen3.8)。
  • 工具调用改进:增强对嵌套对象的解析能力,提升工具调用成功率。
  • 下图展示了在 Unsloth Desktop 中运行 4-bit Qwen3.8-27B 的示例:

qwen3.8 unsloth desktop


继 Qwen3.5 和 Qwen3.6 系列获得广泛社区采用后,我们很高兴推出 Qwen3.8——这是迄今为止 Qwen 开源模型家族中能力最强的一代。

基于 Qwen3.5 的架构基础,Qwen3.8 在编程、专业工作、研究和长周期智能体任务等方面均实现了显著提升。Qwen3.8-27B 将这些进步融入了一个紧凑、易于部署的稠密模型:这是一个原生的视觉语言模型,能够理解图像和视频,并具备灵活的思维控制能力,旨在更可靠地完成复杂的多步骤任务。

https://huggingface.co/unsloth/Qwen3.8-27B-NVFP4#qwen38-highlightsQwen3.8 亮点

Qwen3.8-27B 具有以下增强特性:

  • 核心能力:在编程、专业工作、研究和长周期智能体任务等方面进行了全面改进。
  • 智能体执行:增强了自主规划能力并能更好地处理环境反馈,从而实现更可靠的端到端任务完成。
  • 下游兼容性:更广泛地支持流行的开发框架和工具,使其更容易集成到你现有的技术栈中。
  • 灵活的思维控制:思维模式默认开启,可按需禁用;可通过 reasoning_effort 调节推理深度,并通过 preserve_thinking 在历史消息中保留推理上下文。
  • 视觉语言理解:原生支持图像和视频理解,涵盖从 STEM 图表和文档到长达数小时的视频。

https://huggingface.co/unsloth/Qwen3.8-27B-NVFP4#model-overview模型概述

  • 类型:带视觉编码器的因果语言模型
  • 训练阶段:预训练 & 后训练
  • 语言模型
    • 参数量:27B
    • 隐藏维度:5120
    • 词嵌入:248,320(填充后)
    • 层数:64
    • 隐藏层布局:16 × (3 × (门控 DeltaNet → FFN) → 1 × (门控注意力 → FFN))
    • 门控 DeltaNet:
      • 线性注意力头数:V 为 48,QK 为 16
      • 头维度:128
    • 门控注意力:
      • 注意力头数:Q 为 24,KV 为 4
      • 头维度:256
    • 旋转位置嵌入维度:64
    • 前馈网络:
      • 中间维度:17,408
    • LM 输出维度:248,320(填充后)
    • MTP(多令牌预测):使用多步进行训练
  • 上下文长度:原生支持 262,144,可扩展至 1,000,000 个令牌。

https://huggingface.co/unsloth/Qwen3.8-27B-NVFP4#best-practices最佳实践

为达到最佳性能,我们推荐以下设置:

  1. 采样参数:我们建议使用以下采样参数组合:
    • 思维模式:temperature=1.0top_p=0.95top_k=20min_p=0.0presence_penalty=0.0repetition_penalty=1.0
    • 指令(或非思维)模式:temperature=0.7top_p=0.80top_k=20min_p=0.0presence_penalty=1.5repetition_penalty=1.0 在支持的框架中,你可以将 presence_penalty 参数在 0 到 2 之间调整以减少无尽的重复。但是,使用较高的值偶尔可能导致语言混杂和模型性能轻微下降。
  2. 充足的输出长度:为优化智能体任务的性能,我们建议分配足够的输出长度,以便模型能够生成详细且全面的响应。对于支持内部推理和最终输出独立令牌限制的框架,我们建议在 1M 上下文长度内进行如下配置:
    • 推理内容:将最大输出长度设置为 262,144 个令牌。
    • 最终响应:将最大输出长度设置为 131,072 个令牌。 这些设置为复杂推理提供了必要的容量,同时确保有足够的空间生成高质量的最终交付成果。
  3. 处理超长文本:Qwen3.8-27B 原生支持高达 262,144 个令牌的上下文长度。对于总长度(包括输入和输出)超过此限制的长周期任务,我们建议使用 RoPE 缩放技术(例如 YaRN)来有效处理长文本。
  4. 长视频理解:为优化纯文本和图像的推理效率,已发布的 video_preprocessor_config.json 文件中的 size 参数采用了保守配置。建议将 video_preprocessor_config 文件中的 longest_edge 参数设置为 469,762,048(对应 224k 视频令牌),以实现对小时级视频的更高速率采样,从而获得更好的性能。例如:
    {"longest_edge": 469762048, "shortest_edge": 4096}
    

https://huggingface.co/unsloth/Qwen3.8-27B-NVFP4#citation引用

如果你觉得我们的工作有帮助,请随时引用。

@misc{qwen38,
    title = {{Qwen3.8-Max}: A New Bar for Coding and Cowork},
    url = {https://qwen.ai/blog?id=qwen3.8},
    author = {{Qwen Team}},
    month = {August},
    year = {2026}
}

上月下载量90,924

模型树 unsloth/Qwen3.8-27B-NVFP4 https://huggingface.co/docs/hub/model-cards#specifying-a-base-model

使用 unsloth/Qwen3.8-27B-NVFP4 的 Space 数量:1

包含 unsloth/Qwen3.8-27B-NVFP4 的集合:

相似文章

nvidia/Qwen3.6-27B-NVFP4

Hugging Face Models Trending

NVIDIA发布了Qwen3.6-27B-NVFP4,这是阿里巴巴Qwen3.6-27B模型的量化版本,针对在NVIDIA GPU上的部署进行了优化,支持文本、图像和视频输入。

三元 Qwen3.6 27B 在 3090 上测试!

Reddit r/LocalLLaMA

用户在 RTX 3090 上测试了三元量化版本的 Qwen3.6 27B,使用两个槽位和 100k KV 缓存,占用 21GB 显存,达到了 60 tk/s 的速度,质量良好且工具调用稳定。

Wow!Qwen 3.6:35b-a3b 在 3090 上……太惊人了。

Reddit r/artificial

一位用户分享了在二手 RTX 3090 上运行量化版 Qwen 3.6:35b-a3b 模型的惊人结果:将模型放入显存后,输出速度达到每秒 160 个 token,并以 75 秒的视频处理时间展示了视觉能力。