我在有限显存(16-20GB)上对 Qwen 3.8 27B 的测试
摘要
本文测试了在有限显存环境下各种量化版本的 Qwen 3.8 27B AI 模型,比较了它们在动画生成、应用开发和单词生成等任务上的表现。
我对 Qwen 3.8 27B 的不同版本进行了几项测试,主要使用 IQ4_XS 版本,因为它能适配我的显卡。也测试了一些其他模型作为对比。测试 1 创建一个单文件 Three.js 动画:一朵青绿色和金色的机械花朵围绕发光核心绽放,然后无缝闭合。要求电影级灯光、可见齿轮、环绕相机、无文字。这是一项困难任务,源自前沿模型测试,即使它们也未能完美完成。没有模型得到 5/5 满分,这在预料之中。测试 2 这是一个简单的 Tauri+Yew 桌面应用,旨在显示一个富文本编辑器。编辑器应为组件形式,以便轻松在其他应用中复用。AGENTS.md 文件内容:# 功能 - HTML 模式 - 所见即所得模式 ## BB Code 标签 - `<b></b>`:粗体文本 - `<i></i>`:斜体文本 - `<u></u>`:下划线 - `<span style="color: #FFAA41;"></span>`:文本颜色 - `<sub></sub>`:下标 - `<sup></sup>`:上标 - `<h1></h1>`:标题(h1 到 h6) - `<pre><code></code></pre>`:代码块 - `<blockquote></blockquote>`:引用块 - `<a href="https://"></a>`:链接,需提示输入链接和链接文本 - 处理 ` `、`<`、`>` - 鼠标悬停工具提示 应能组合两个或多个样式,例如粗体红色文本。两种模式都应可编辑。测试 3 给我 20 个 3 个字母的波兰语单词 有趣的是,有些模型会卡在这个任务上。我怀疑与量化相关。我打算保留此测试来检验量化效果。结果:对于测试 1,GSQ-RCO IQ3_S 和 Byteshape 版本表现最好,尽管各自在正确灯光方面存在问题。Twin Turbo 搞砸了齿轮,但花瓣比 Unsloth 好,后者可能因阴影获得额外加分。Cold Fusion 完全搞砸了,Nex N2 Mini(APEX Quality)也彻底失败。Swift 模型提供的结果接近 Unsloth。对于测试 2(一个长而复杂的任务)- Unsloth 似乎最可靠,能在一小时内交付可用的解决方案。- Twin Turbo 在 15 分钟内完成,但有轻微错误,额外花了 10 分钟解决,因此也值得推荐。可能需要更详细的 AGENTS 文件来描述测试等。我还要求它在所见即所得模式添加行号,这额外花了 25 分钟和更多提示,因为有些复杂。需要适应可变字号。- Swift 模型花了几个小时,多次无故停止,但最终交付,尽管有一些轻微错误并自行修复 - GSQ-RCO 完成了,但耗时 5 小时,停止过一次,不过像 Swift 一样,我只需说“继续” - Nex N2 Mini:基础功能存在重大问题,不推荐 - Byteshape:工作 4 小时后有轻微问题,但自行修复了 - HauhauCS Aggressive:几小时后出现颜色选择器问题,但能交付 测试 3(源自 Reddit),出人意料的是 Unsloth 表现不佳:- Unsloth:陷入重复 1 个单词的循环 - Nex N2 Mini:卡住 - Twin Turbo:运行一段时间后交付 - Byteshape:快速给出正确结果 - Swift:类似 Byteshape - GSQ-RCO:运行良好 - Gemma4 12B Q5_K_M:即时给出结果 Swift 模型的内存占用明显大于其他 IQ4_XS 版本,在 7900XT 上仅允许 128k 上下文窗口,因此我只考虑在 24GB 显卡上使用其 Q4_K_M 版本。其他版本至少能轻松支持约 150k 上下文。在 16GB 显卡上,GSQ-RCO 似乎是赢家,Byteshape 紧随其后。两者耗时更长,这可视为一种成本。
相似文章
我对比测试了 Qwen3.8 27B IQ3_XXS (10.18GiB) 和 Bonsai Ternary PQ2 (6.42GiB)
作者在有限的显存下比较了 Qwen3.8 27B IQ3_XXS 和 Bonsai Ternary PQ2 的性能,发现 Qwen 更快且使用的 token 更少,而 Bonsai 文件更小但生成时间更长。
高显存本地编码模型——依然首选 Qwen 3.6 27B 吗?
用户分享了使用 Qwen 3.6 27B 进行本地编码任务的经验,并寻求适合拥有 224GB 显存系统的更大模型(100B 以上)的推荐。
女士们,先生们,我向大家介绍 Qwen3.8 27b 1位量化脑损伤版本
一位用户在8GB显存系统上测试了 unsloth 1位量化版本的 Qwen 3.8 27B AI模型,并发现结果很有趣。
在单卡5090上本地运行Qwen 3.8 27B的测试
本文展示了在单卡5090 GPU上本地运行Qwen 3.8 27B AI模型的能力,使用Row-Bot生成丰富的动画,展示从语言合成到物理模拟的任务。
Qwen3.8-27B:更慢的词元,更快更好的结果
Qwen3.8-27B 是一款新型人工智能模型,强调实际运行时间而非词元生成速度,能在配备32GB显存的消费级硬件上本地部署,并提供卓越的智能表现。