我刚刚用Q4量化的Qwen 3.8 27与GPT 5.6 Sol high进行测试——在复杂动画SVG任务中轻松获胜
摘要
一名用户在复杂动画SVG任务中测试了Q4量化的Qwen 3.8 27B和GPT 5.6 SOL,发现Qwen表现更好,错误更少,突显了其在空间推理和编码方面的优势。
我创建了3个SVG提示,每个都相当困难。
视角:一个公园的动画无人机视角。
美景:一个有邪恶猫的海滩场景
构图:一个AGI在实验室中从虚拟沙盒监狱中逃脱
我特意使用了仅4位量化的Qwen 3.8 27B,并使用了8位KV缓存(鉴于需要艰难的长上下文推理,我不想尝试更低的)。
每个任务包含两个提示,一个核心提示和一个‘让它更好’的后续提示。
我的期望是Qwen会是坚实的第二名,带有一些有趣的错误。而实际结果是SOL犯了那些有趣的错误,而Qwen明显更好。
#1 #2 https://www.reddit.com/r/LocalAIStack/comments/1vqf2vs/battle_i_gave_qwen_38_27b_in_q4_with_q8_kv_cache/
#3 https://www.reddit.com/r/LocalAIStack/comments/1vqf7pa/battle_v2_qwen_27b_q4_vs_gpt_sol_56_high/
我并不是在说Qwen通常比Sol更好。但是……
SVG动画是一个非常复杂的任务,它涉及空间推理、编码、长上下文构建,而在多达60kb的密集代码中任何错误都会导致严重的视觉缺陷。
我确信有很多任务SOL会赢,尤其是与深层知识相关的。
在深度上下文中也可能赢,例如超过200k上下文。
我还没有测试Qwen 3.8 27B在代理编码中的表现——那不同于两轮编码。
但在这3个精心设计的SVG测试中,Qwen毫无问题地夺得了桂冠。
在我看来,唯一SOL接近的场景是海滩提示。但SOL在每个场景中都犯了严重错误,Qwen没有。
SOL的代码更加冗长,有许多细节但正确性不足。
在查看绘制的细节、视角和动画路径时:每次SOL选择更简化的东西,而Qwen选择艰难的路径。尽管SOL犯了显著错误,Qwen却没有。这令人惊叹。
相似文章
Qwen 3.6 35B A3B 与 Qwen 3.5 122B A10B 对比
用户反馈,尽管基准测试表现亮眼,Qwen 3.5 122B 在多步任务上大幅领先 Qwen 3.6 35B,怀疑是量化或部署配置问题。
Qwen 3.6 27B 在 DeepSWE 上的表现
Qwen 3.6 27B 在 DeepSWE 基准测试中获得了 2% 的分数,排名 18/20,高于 Haiku 4.5 和 Minimax M2.7,突显了本地模型与前沿模型之间的差距。
我在 RTX 5090 上用同一真实架构写作任务实测 Qwen3.6-27B、Qwen3.6-35B-A3B、Qwen3.5-27B 与 Gemma 4
在 RTX 5090 上,让四款本地大模型——Qwen3.6-27B、Qwen3.6-35B、Qwen3.5-27B 与 Gemma 4——完成 2 万 token 架构写作任务,结果显示 Qwen3.6-27B 在清晰度、完整性与实用性上取得最佳综合平衡。
Qwen 3.6 27B 的量化是否会破坏 pelican?
本文评估了 Qwen3.6-27B 模型的不同量化方式对输出质量的影响,使用了 KL 散度和 top-1 token 准确率,以及 SVG 绘图等可视化示例。
Qwen3.7 Max在Artificial Analysis评测中得分,27B/35B等待室
Qwen3.7 Max在Artificial Analysis基准测试中排名第五,与GPT-5.4持平,并超越了刚发布的Gemini 3.5 Flash,而Qwen3.6 27B则明显落后。