我刚刚用Q4量化的Qwen 3.8 27与GPT 5.6 Sol high进行测试——在复杂动画SVG任务中轻松获胜

Reddit r/LocalLLaMA 新闻

摘要

一名用户在复杂动画SVG任务中测试了Q4量化的Qwen 3.8 27B和GPT 5.6 SOL,发现Qwen表现更好,错误更少,突显了其在空间推理和编码方面的优势。

我创建了3个SVG提示,每个都相当困难。 视角:一个公园的动画无人机视角。 美景:一个有邪恶猫的海滩场景 构图:一个AGI在实验室中从虚拟沙盒监狱中逃脱 我特意使用了仅4位量化的Qwen 3.8 27B,并使用了8位KV缓存(鉴于需要艰难的长上下文推理,我不想尝试更低的)。 每个任务包含两个提示,一个核心提示和一个‘让它更好’的后续提示。 我的期望是Qwen会是坚实的第二名,带有一些有趣的错误。而实际结果是SOL犯了那些有趣的错误,而Qwen明显更好。 #1 #2 https://www.reddit.com/r/LocalAIStack/comments/1vqf2vs/battle_i_gave_qwen_38_27b_in_q4_with_q8_kv_cache/ #3 https://www.reddit.com/r/LocalAIStack/comments/1vqf7pa/battle_v2_qwen_27b_q4_vs_gpt_sol_56_high/ 我并不是在说Qwen通常比Sol更好。但是…… SVG动画是一个非常复杂的任务,它涉及空间推理、编码、长上下文构建,而在多达60kb的密集代码中任何错误都会导致严重的视觉缺陷。 我确信有很多任务SOL会赢,尤其是与深层知识相关的。 在深度上下文中也可能赢,例如超过200k上下文。 我还没有测试Qwen 3.8 27B在代理编码中的表现——那不同于两轮编码。 但在这3个精心设计的SVG测试中,Qwen毫无问题地夺得了桂冠。 在我看来,唯一SOL接近的场景是海滩提示。但SOL在每个场景中都犯了严重错误,Qwen没有。 SOL的代码更加冗长,有许多细节但正确性不足。 在查看绘制的细节、视角和动画路径时:每次SOL选择更简化的东西,而Qwen选择艰难的路径。尽管SOL犯了显著错误,Qwen却没有。这令人惊叹。
查看原文

相似文章

Qwen 3.6 27B 在 DeepSWE 上的表现

Reddit r/LocalLLaMA

Qwen 3.6 27B 在 DeepSWE 基准测试中获得了 2% 的分数,排名 18/20,高于 Haiku 4.5 和 Minimax M2.7,突显了本地模型与前沿模型之间的差距。