详细评测:Qwen 3.8 27B 非常擅长利用其现实世界知识。其'深度思考'使其达到 Sonnet 级性能,并有潜力实现 Opus 级结果。
摘要
本评测赞扬了 Qwen 3.8 27B 在现实世界知识方面的改进以及处理复杂编码任务(如街机游戏重现)的能力,其性能接近 Sonnet 和 Opus 等前沿模型。
大家好!我终于抽时间测试了 Qwen 3.8 27B。我使用 Unsloth 的 UD-Q8_K_XL 量化作为 Qwen 3.6 27B 的替代品,量化大小相同。哇——这东西可不是闹着玩的。我有许多基准测试提示来评估模型的'智能'和可用性,但其中一个常用提示是要求它 1:1 重现经典街机游戏(如 Galaga、Donkey Kong、Pac-Man 等)。我这样做是为了看它能正确实现哪些小细节。我几乎在机器上能运行的所有模型上都测试了这个过程。总共,我有 3 张 3090 显卡和 1 张 Tesla P40,以及 128GB 系统内存。我还在 WebUI 和多个框架中测试了前沿模型。我主要使用 Qwen 3.6,偶尔切换到 Deepseek V4 Flash。现在我开始觉得后者不再必要了。最初在这些游戏/测试中,Qwen 3.6 能掌握基础(可能还有一些花哨的效果和动画),但感觉总是只有 75% 的效果。它很少出现技术问题,但小功能和微小细节要么缺失,要么'半吊子'实现。我可以轻松地进一步指导它添加这些,并进行一些'手把手'指导。总体而言,Qwen 3.6 在同类模型中相当可比,但最终精度在前沿模型的结果中最好。通过额外的提示和多阶段规划阶段(通过我自定义的框架,使用提示引导它思考小细节,然后将关键元素注入新会话的提示),我成功提取了模型内部知识中明显存在但完全忘记的相关提示的小细节。Qwen 3.8 思考很多,但它能提取这些微小细节,并在事后完美实现。这使得等待和上下文使用变得值得,并极大地缩小了本地模型和专有模型之间的差距。例如:提示:'创建一个单页 HTML + Tailwind CSS + JavaScript 的 Galaga 重现,1:1 还原原版街机游戏。' Qwen 3.6 27B 的'Galaga'克隆版:https://preview.redd.it/4nx5c98gyujh1.png?width=874&format=png&auto=webp&s=5984272dff7636b68f968f22da57f5b827860065 这个'Galaga'克隆版最终基本上变成了太空入侵者克隆版。敌人不会反击或俯冲或做任何特殊动作,直到我进行额外提示。它看起来不错,但与原版游戏毫不忠实。Qwen 3.8 27B 在这方面彻底碾压:https://preview.redd.it/yae6n9753vjh1.png?width=992&format=png&auto=webp&s=2d461ab4483a101533a62cdeaef547543d0f23c8 Qwen 3.8 没有严格使用 SVG 多边形设计敌人,而是使用了类似像素位图的东西(这是正确的词吗?)来动态构建精灵:https://preview.redd.it/gen91i2i3vjh1.png?width=1398&format=png&auto=webp&s=b565315ab7aa8e2b51d082ec887b9ae389e47fcf 这相当酷。屏幕上似乎还有类似 CRT 的滤镜和效果,包括屏幕上的开机模拟。不仅如此,它们还是动画的。每个精灵在两种状态之间切换(如上面代码中的第一行和第二行)。它还成功实现了小的游戏细节,比如角色俯冲、敌人向你射击。我非常惊讶地发现 Qwen 3.8 记住并实现了战斗机捕获系统。在 Galaga 中,有一个特殊敌人可以捕获你的船并用它对付你,但通过射击敌人你可以夺回它,并在屏幕上同时拥有两艘船。Qwen 3.8 记住并实现了这一点。唯一的问题是,特殊敌人不是用光束捕获你,而是直接撞向你。尽管如此,令人印象深刻的是它记住并以某种方式实现了这一点——在后续提示中进行小修正或更精确的起始提示就能修复它。它还实现了音效,而 Qwen 3.6 甚至没有尝试。它还有待机屏幕和页面打开但不在屏幕上的屏幕:https://preview.redd.it/yxybaki84vjh1.png?width=626&format=png&auto=webp&s=202da21c84c3bf08ee119a7980411d16dc2bd7e9 就像真正的街机柜运行游戏一样,甚至有'投币'模拟。不过,如你所见,精灵(和音效)与 Namco 的 Galaga 并非 1:1,但比 Qwen 3.6 更接近、更有品味。现在,回到帖子标题,Qwen 3.8 思考很多。幸运的是,我的机器能处理,因为高吞吐量,但任何需要卸载层的人可能要等很久。不过,这里是我测试的主要问题:Qwen 3.6 的 Galaga 克隆版用了 8 秒思考。Qwen 3.8 (xHigh) 的 Galaga 克隆版用了 15 分钟思考。如果只是告诉它用后续提示手动实现这些功能,可能更值得。我相信如果我花时间手把手指导它实现捕获系统、音效等,总共可能只需 5 分钟(或 8-10 分钟,假设我需要等待更多思考令牌、代码重新生成和更多调试)。我尝试了 :low 和 :medium 设置,得到这些结果:Qwen 3.8 27b (low):https://preview.redd.it/viwdd4dukvjh1.png?width=940&format=png&auto=webp&s=53bba90e2b8cad440ae514f2dd810eeef0f3d9bc 可玩性方面,与 Qwen 3.6 非常相当。但它确实有一些音效!角色俯冲但不射击或绑架/捕获玩家。总思考时间 3 秒。Qwen 3.8 27b (medium):https://preview.redd.it/dfuxe5w6nvjh1.png?width=962&format=png&auto=webp&s=42476d436bab01c986844400979aa8fcc2f81c21 我发现尽管思考了 3 分钟,但大部分思考内容实际上是起草代码块和标记,它只重新考虑和重写了一块一两次。当它输出实际响应时,MTP 变得非常快(91 tk/s 对比起始速率 62 tk/s)。质量方面,我认为这是一个非常满意的折衷,惊讶它不是默认设置。推理更值得等待,它交付了 xHigh 交付结果的约 90%。真正的 8 位角色回归(再次带有两个动画帧)、音效、适当的俯冲和射击。它忘记了绑架/捕获系统,但通过一个快速的后续提示和 2 分钟更多思考,它轻松实现了。更令人印象深刻的是,由于纹理是文本位图格式,我想看看它基于参考图片实现原版游戏图形的效果如何。https://preview.redd.it/njhdw63sovjh1.png?width=770&format=png&auto=webp&s=f9fdc94d9034d4a5fb49c7e3edd7fa20a0857719 我提供了上面的图片,当它实现纹理相当忠实(除了玩家飞船,尽管所有东西仍有杂牌外观),并给它们动画时,我相当印象深刻:https://preview.redd.it/yxc4dt1uqvjh1.png?width=792&format=png&auto=webp&s=09390db28c583f595276d16d0cb551d4d047d56d 在重新生成提示给它另一个机会后,它设法让飞船更接近原版,但其他一些精灵有偏差。我将认为它在 medium 模式下'大部分'正确。我将给它好处的怀疑,假设一两个后续提示可以消除那些相当偏离的。xHigh 没有这个问题,但质量相同。我不认为推理会真正改善,因为它对图像内容的理解没有帮助。https://preview.redd.it/j8c7ni4ttvjh1.png?width=92&format=png&auto=webp&s=15881cf5d6640cc0ec5cf0a7a512ee7c26fc1d0d 我让 Claude Sonnet 5 经过同样的测试:https://preview.redd.it/f5lc8f0xjvjh1.png?width=866&format=png&auto=webp&s=f48723828168b67e75e266d53a87b5d225232fca Sonnet 的
相似文章
Qwen 3.8 Max 的 Artificial Analysis 分数
Reddit 帖子分享了 Qwen 3.8 Max 的 Artificial Analysis 分数,称赞它是 Opus 4.7 的廉价替代品。
Qwen 3.8 Max:极其擅长判断哪些不该构建
Qwen 3.8 Max 的实操评测,重点介绍其速度、强大的规划与简化能力、严谨的实验态度以及创造性实现能力。
Qwen 3.8 - 27B 是颠覆性的
文章重点介绍了 Qwen 3.8 27B 模型在网络安全任务中的卓越表现,特别是恶意软件分析,超越了之前的模型如 Opus。它讨论了基准测试和 AI 在漏洞利用能力方面的影响。
Qwen 3.8 27B 表现优异,但默认启用过度推理模式
Qwen 3.8 27B 是阿里巴巴通义千问实验室推出的一款强大的开源270亿参数多模态大语言模型。它在基准测试中表现突出,但被批评默认启用过度推理模式,这在消费级硬件上拖慢了运行速度。
Qwen 3.8 27b 就像你的机器上的 Opus 4.6
这篇文章讨论了 Qwen 3.8 27b 的发布,这是一个 270 亿参数的 AI 模型,据报道其性能可与更大的模型如 Opus 4.6 相媲美,引发了关于 AI 订阅未来和本地 AI 效率的问题。