我的笔记本上的Qwen3.6-35B-A3B画出的鹈鹕比Claude Opus 4.7更好
摘要
Simon Willison对比了在MacBook Pro上本地运行的Qwen3.6-35B-A3B与Claude Opus 4.7,发现Qwen生成的骑自行车的鹈鹕和骑独轮车的火烈鸟的SVG插图更好,不过他指出这个狭窄的基准测试并不能反映更广泛的模型能力。
暂无内容
查看缓存全文
缓存时间: 2026/04/20 08:27
# Qwen3.6-35B-A3B 在我的笔记本上画出的鹈鹕比 Claude Opus 4.7 更好
来源:https://simonwillison.net/2026/Apr/16/qwen-beats-opus/
2026年4月16日
对于那些(不明智地)把我的 `pelican riding a bicycle` 基准测试(https://simonwillison.net/tags/pelican-riding-a-bicycle/)认真当作测试模型的稳健方法的人,以下是今早两大模型发布——阿里巴巴的 Qwen3.6-35B-A3B(https://qwen.ai/blog?id=qwen3.6-35b-a3b)和 Anthropic 的 Claude Opus 4.7(https://www.anthropic.com/news/claude-opus-4-7)——所画的鹈鹕。
这是 Qwen 3.6 的鹈鹕,使用 Unsloth 的量化模型 `Qwen3.6-35B-A3B-UD-Q4_K_S.gguf`(https://huggingface.co/unsloth/Qwen3.6-35B-A3B-GGUF/blob/main/Qwen3.6-35B-A3B-UD-Q4_K_S.gguf)(20.9GB),通过 LM Studio(https://lmstudio.ai/)和 `llm-lmstudio`(https://github.com/agustif/llm-lmstudio)插件在我的 MacBook Pro M5 上运行——对话记录在此(https://gist.github.com/simonw/4389d355d8e162bc6e4547da214f7dd2):
自行车车架形状正确。天空中有云朵。鹈鹕的喉囊看起来蠢萌。地面上的文字写着“Pelican on a Bicycle!”
这是我从 Anthropic 全新的 Claude Opus 4.7(https://www.anthropic.com/news/claude-opus-4-7)得到的(对话记录(https://gist.github.com/simonw/afcb19addf3f38eb1996e1ebe749c118)):
自行车车架形状完全不对。没有云,只有一个黄色的太阳。鹈鹕正在回头看自己的身后,喉囊也没有我期望的那么明显。
这一局我给 Qwen 3.6。Opus 居然把自行车车架画错了!
我又用 `thinking_level: max` 试了一次 Opus,结果也没好到哪里去(对话记录(https://gist.github.com/simonw/7566e04a81accfb9affda83451c0f363)):
自行车车架形状完全不对,而且错法不同了。线条更粗。鹈鹕看起来稍微更像鹈鹕了。
#### 我不认为 Qwen 在作弊
很多人确信这些实验室在针对我的愚蠢基准测试进行训练(https://simonwillison.net/2025/Nov/13/training-for-pelicans-riding-bicycles/)。我并不这么认为,但说实话,这个结果确实让我心里闪过一丝疑虑。所以我公开一个秘密备用测试——以下是我从 Qwen3.6-35B-A3B 和 Opus 4.7 那里得到的“生成一只火烈鸟骑独轮车的 SVG”:
这一局我也给 Qwen,部分原因是它出色的 SVG 注释 `<!-- Sunglasses on flamingo! -->`。
#### 我们能从中得到什么教训?
鹈鹕基准测试一直是玩笑——它主要是在说明比较这些模型是多么尴尬和荒谬的一项任务。
这个玩笑的怪异之处在于,大多数情况下,鹈鹕画的质量与模型的通用实用性之间存在直接关联。那些 2024 年 10 月的首批鹈鹕(https://simonwillison.net/2024/Oct/25/pelicans-on-a-bicycle/)简直一塌糊涂。而近期的作品(https://simonwillison.net/tags/pelican-riding-a-bicycle/)通常要好得多——以至于 Gemini 3.1 Pro 产生的插图(https://simonwillison.net/2026/Feb/19/gemini-31-pro/)你甚至能在某些场合真正使用,前提是你有急迫的需要画一只骑自行车的鹈鹕。
而如今,连这种松散的实用性关联也被打破了。我非常尊重 Qwen,但我非常怀疑一个 21GB 的量化版本会比 Anthropic 最新的专有发布更强大或更有用。
不过,如果你需要的就是一幅鹈鹕骑自行车的 SVG 插图,那么目前来看,在笔记本上运行的 Qwen3.6-35B-A3B 比 Opus 4.7 更靠谱!
相似文章
Qwen 3.6 27B 的量化是否会破坏 pelican?
本文评估了 Qwen3.6-27B 模型的不同量化方式对输出质量的影响,使用了 KL 散度和 top-1 token 准确率,以及 SVG 绘图等可视化示例。
Qwen3.8 27B 在 SVG 生成上超出了我的预期 :D
一位用户在 SVG 生成任务中测试了 Qwen3.8 27B 模型,并使用了一个复杂提示,发现结果超出了预期,突显了该模型在创造性任务上的能力。
新基准测试发布!
新基准测试对比了Qwen3.8-27b、Sol 5.6和Qwen3.6-35B模型在生成沙漠中骆驼背景下的自行车上的马SVG图像时的性能,使用了包含拼写错误的提示。
详细评测:Qwen 3.8 27B 非常擅长利用其现实世界知识。其'深度思考'使其达到 Sonnet 级性能,并有潜力实现 Opus 级结果。
本评测赞扬了 Qwen 3.8 27B 在现实世界知识方面的改进以及处理复杂编码任务(如街机游戏重现)的能力,其性能接近 Sonnet 和 Opus 等前沿模型。
本地之王归来!Qwen3.8-27B 性能图表
Qwen3.8-27B 是一款新的本地可运行模型,据报道其性能超越之前的本地模型,可与 Opus4.6 媲美,并分享了基准测试图表以及 ModelScope 和 HuggingFace 的链接。