@TheAhmadOsman: 顺便说一下,Qwen 3.8 27B 的 NVFP4 版本可以在单个 RTX 5090 上运行。
摘要
Qwen 3.8 27B 模型已推出 NVFP4 量化版本,使其能在单个 RTX 5090 GPU 上运行,并在编码、智能任务和视觉语言理解方面有所增强。
查看缓存全文
缓存时间: 2026/08/15 13:58
顺便说一下,Qwen 3.8 27B 的 NVFP4 版本可以装进单张 RTX 5090 显卡
https://t.co/3lTp9EPJQR
unsloth/Qwen3.8-27B-NVFP4 · Hugging Face
来源:https://huggingface.co/unsloth/Qwen3.8-27B-NVFP4
https://huggingface.co/unsloth/Qwen3.8-27B-NVFP4#read-our-how-to-run-qwen38-27b-guide阅读我们的《如何运行 Qwen3.8-27B》指南!(https://unsloth.ai/docs/models/qwen3.8)
此 NVFP4 量化版采用 Unsloth Dynamic V3.0(预览版),实现了最先进的量化性能。
- 支持开发者角色,使 Qwen3.8 能在 Codex 等智能体工具中运行!
- 支持 MTP 加速推理。
- Qwen3.8 现在可以在 Unsloth Desktop (https://unsloth.ai/docs/new/desktop) 中运行和微调。阅读我们的指南 (https://unsloth.ai/docs/models/qwen3.8)。
- 工具调用改进:增强对嵌套对象的解析能力,提升工具调用成功率。
- 下图展示了在 Unsloth Desktop 中运行 4-bit Qwen3.8-27B 的示例:
qwen3.8 unsloth desktop
继 Qwen3.5 和 Qwen3.6 系列获得广泛社区采用后,我们很高兴推出 Qwen3.8——这是迄今为止 Qwen 开源模型家族中能力最强的一代。
基于 Qwen3.5 的架构基础,Qwen3.8 在编程、专业工作、研究和长周期智能体任务等方面均实现了显著提升。Qwen3.8-27B 将这些进步融入了一个紧凑、易于部署的稠密模型:这是一个原生的视觉语言模型,能够理解图像和视频,并具备灵活的思维控制能力,旨在更可靠地完成复杂的多步骤任务。
https://huggingface.co/unsloth/Qwen3.8-27B-NVFP4#qwen38-highlightsQwen3.8 亮点
Qwen3.8-27B 具有以下增强特性:
- 核心能力:在编程、专业工作、研究和长周期智能体任务等方面进行了全面改进。
- 智能体执行:增强了自主规划能力并能更好地处理环境反馈,从而实现更可靠的端到端任务完成。
- 下游兼容性:更广泛地支持流行的开发框架和工具,使其更容易集成到你现有的技术栈中。
- 灵活的思维控制:思维模式默认开启,可按需禁用;可通过
reasoning_effort调节推理深度,并通过preserve_thinking在历史消息中保留推理上下文。 - 视觉语言理解:原生支持图像和视频理解,涵盖从 STEM 图表和文档到长达数小时的视频。
https://huggingface.co/unsloth/Qwen3.8-27B-NVFP4#model-overview模型概述
- 类型:带视觉编码器的因果语言模型
- 训练阶段:预训练 & 后训练
- 语言模型
- 参数量:27B
- 隐藏维度:5120
- 词嵌入:248,320(填充后)
- 层数:64
- 隐藏层布局:16 × (3 × (门控 DeltaNet → FFN) → 1 × (门控注意力 → FFN))
- 门控 DeltaNet:
- 线性注意力头数:V 为 48,QK 为 16
- 头维度:128
- 门控注意力:
- 注意力头数:Q 为 24,KV 为 4
- 头维度:256
- 旋转位置嵌入维度:64
- 前馈网络:
- 中间维度:17,408
- LM 输出维度:248,320(填充后)
- MTP(多令牌预测):使用多步进行训练
- 上下文长度:原生支持 262,144,可扩展至 1,000,000 个令牌。
https://huggingface.co/unsloth/Qwen3.8-27B-NVFP4#best-practices最佳实践
为达到最佳性能,我们推荐以下设置:
- 采样参数:我们建议使用以下采样参数组合:
- 思维模式:
temperature=1.0、top_p=0.95、top_k=20、min_p=0.0、presence_penalty=0.0、repetition_penalty=1.0 - 指令(或非思维)模式:
temperature=0.7、top_p=0.80、top_k=20、min_p=0.0、presence_penalty=1.5、repetition_penalty=1.0在支持的框架中,你可以将presence_penalty参数在 0 到 2 之间调整以减少无尽的重复。但是,使用较高的值偶尔可能导致语言混杂和模型性能轻微下降。
- 思维模式:
- 充足的输出长度:为优化智能体任务的性能,我们建议分配足够的输出长度,以便模型能够生成详细且全面的响应。对于支持内部推理和最终输出独立令牌限制的框架,我们建议在 1M 上下文长度内进行如下配置:
- 推理内容:将最大输出长度设置为 262,144 个令牌。
- 最终响应:将最大输出长度设置为 131,072 个令牌。 这些设置为复杂推理提供了必要的容量,同时确保有足够的空间生成高质量的最终交付成果。
- 处理超长文本:Qwen3.8-27B 原生支持高达 262,144 个令牌的上下文长度。对于总长度(包括输入和输出)超过此限制的长周期任务,我们建议使用 RoPE 缩放技术(例如 YaRN)来有效处理长文本。
- 长视频理解:为优化纯文本和图像的推理效率,已发布的
video_preprocessor_config.json文件中的size参数采用了保守配置。建议将video_preprocessor_config文件中的longest_edge参数设置为 469,762,048(对应 224k 视频令牌),以实现对小时级视频的更高速率采样,从而获得更好的性能。例如:{"longest_edge": 469762048, "shortest_edge": 4096}
https://huggingface.co/unsloth/Qwen3.8-27B-NVFP4#citation引用
如果你觉得我们的工作有帮助,请随时引用。
@misc{qwen38,
title = {{Qwen3.8-Max}: A New Bar for Coding and Cowork},
url = {https://qwen.ai/blog?id=qwen3.8},
author = {{Qwen Team}},
month = {August},
year = {2026}
}
上月下载量90,924
模型树 unsloth/Qwen3.8-27B-NVFP4 https://huggingface.co/docs/hub/model-cards#specifying-a-base-model
使用 unsloth/Qwen3.8-27B-NVFP4 的 Space 数量:1
包含 unsloth/Qwen3.8-27B-NVFP4 的集合:
相似文章
@DeepTechTR: Qwen 3.6 27B 在16 GB VRAM下速度极快!Pure Quant技术带来的影响——27B模型流畅运行的时代已来临……
Qwen 3.6 27B 在16 GB VRAM上运行快速,得益于'Pure Quant'技术,通过MTP达到40 tokens/s,并支持64k上下文,使得本地AI能在RTX 4060 Ti等消费级GPU上运行。
nvidia/Qwen3.6-27B-NVFP4
NVIDIA发布了Qwen3.6-27B-NVFP4,这是阿里巴巴Qwen3.6-27B模型的量化版本,针对在NVIDIA GPU上的部署进行了优化,支持文本、图像和视频输入。
三元 Qwen3.6 27B 在 3090 上测试!
用户在 RTX 3090 上测试了三元量化版本的 Qwen3.6 27B,使用两个槽位和 100k KV 缓存,占用 21GB 显存,达到了 60 tk/s 的速度,质量良好且工具调用稳定。
Wow!Qwen 3.6:35b-a3b 在 3090 上……太惊人了。
一位用户分享了在二手 RTX 3090 上运行量化版 Qwen 3.6:35b-a3b 模型的惊人结果:将模型放入显存后,输出速度达到每秒 160 个 token,并以 75 秒的视频处理时间展示了视觉能力。
@superalesha: 别急着埋葬RTX 3090,先读完这个!@UnslothAI本周发布了qwen3.6-35b的两个新4位量化版本。我花了…
对Qwen3.6-35B在RTX 3090上的nvfp4、nvfp4-fast和AWQ 4位量化进行了基准测试,结果显示性能相近,而MTP头技巧将吞吐量提升了41%。