我在有限显存(16-20GB)上对 Qwen 3.8 27B 的测试

Reddit r/LocalLLaMA 新闻

摘要

本文测试了在有限显存环境下各种量化版本的 Qwen 3.8 27B AI 模型,比较了它们在动画生成、应用开发和单词生成等任务上的表现。

我对 Qwen 3.8 27B 的不同版本进行了几项测试,主要使用 IQ4_XS 版本,因为它能适配我的显卡。也测试了一些其他模型作为对比。测试 1 创建一个单文件 Three.js 动画:一朵青绿色和金色的机械花朵围绕发光核心绽放,然后无缝闭合。要求电影级灯光、可见齿轮、环绕相机、无文字。这是一项困难任务,源自前沿模型测试,即使它们也未能完美完成。没有模型得到 5/5 满分,这在预料之中。测试 2 这是一个简单的 Tauri+Yew 桌面应用,旨在显示一个富文本编辑器。编辑器应为组件形式,以便轻松在其他应用中复用。AGENTS.md 文件内容:# 功能 - HTML 模式 - 所见即所得模式 ## BB Code 标签 - `<b></b>`:粗体文本 - `<i></i>`:斜体文本 - `<u></u>`:下划线 - `<span style="color: #FFAA41;"></span>`:文本颜色 - `<sub></sub>`:下标 - `<sup></sup>`:上标 - `<h1></h1>`:标题(h1 到 h6) - `<pre><code></code></pre>`:代码块 - `<blockquote></blockquote>`:引用块 - `<a href="https://"></a>`:链接,需提示输入链接和链接文本 - 处理 `&nbsp;`、`&lt;`、`&gt;` - 鼠标悬停工具提示 应能组合两个或多个样式,例如粗体红色文本。两种模式都应可编辑。测试 3 给我 20 个 3 个字母的波兰语单词 有趣的是,有些模型会卡在这个任务上。我怀疑与量化相关。我打算保留此测试来检验量化效果。结果:对于测试 1,GSQ-RCO IQ3_S 和 Byteshape 版本表现最好,尽管各自在正确灯光方面存在问题。Twin Turbo 搞砸了齿轮,但花瓣比 Unsloth 好,后者可能因阴影获得额外加分。Cold Fusion 完全搞砸了,Nex N2 Mini(APEX Quality)也彻底失败。Swift 模型提供的结果接近 Unsloth。对于测试 2(一个长而复杂的任务)- Unsloth 似乎最可靠,能在一小时内交付可用的解决方案。- Twin Turbo 在 15 分钟内完成,但有轻微错误,额外花了 10 分钟解决,因此也值得推荐。可能需要更详细的 AGENTS 文件来描述测试等。我还要求它在所见即所得模式添加行号,这额外花了 25 分钟和更多提示,因为有些复杂。需要适应可变字号。- Swift 模型花了几个小时,多次无故停止,但最终交付,尽管有一些轻微错误并自行修复 - GSQ-RCO 完成了,但耗时 5 小时,停止过一次,不过像 Swift 一样,我只需说“继续” - Nex N2 Mini:基础功能存在重大问题,不推荐 - Byteshape:工作 4 小时后有轻微问题,但自行修复了 - HauhauCS Aggressive:几小时后出现颜色选择器问题,但能交付 测试 3(源自 Reddit),出人意料的是 Unsloth 表现不佳:- Unsloth:陷入重复 1 个单词的循环 - Nex N2 Mini:卡住 - Twin Turbo:运行一段时间后交付 - Byteshape:快速给出正确结果 - Swift:类似 Byteshape - GSQ-RCO:运行良好 - Gemma4 12B Q5_K_M:即时给出结果 Swift 模型的内存占用明显大于其他 IQ4_XS 版本,在 7900XT 上仅允许 128k 上下文窗口,因此我只考虑在 24GB 显卡上使用其 Q4_K_M 版本。其他版本至少能轻松支持约 150k 上下文。在 16GB 显卡上,GSQ-RCO 似乎是赢家,Byteshape 紧随其后。两者耗时更长,这可视为一种成本。
查看原文

相似文章

在单卡5090上本地运行Qwen 3.8 27B的测试

Reddit r/ArtificialInteligence

本文展示了在单卡5090 GPU上本地运行Qwen 3.8 27B AI模型的能力,使用Row-Bot生成丰富的动画,展示从语言合成到物理模拟的任务。

Qwen3.8-27B:更慢的词元,更快更好的结果

Reddit r/LocalLLaMA

Qwen3.8-27B 是一款新型人工智能模型,强调实际运行时间而非词元生成速度,能在配备32GB显存的消费级硬件上本地部署,并提供卓越的智能表现。