使用 GPT-5.6、Claude、Gemini 和 Grok “绘制”蒙娜丽莎
摘要
一项实验让四个视觉模型(GPT-5.6 Sol、Claude Fable 5、Grok 4.5、Gemini 3.6 Flash)在彩铅绘画竞技场中相互较量,要求它们通过工具使用来重现《蒙娜丽莎》和《星夜》等目标。结果显示令人惊讶的成本与质量权衡,其中 Grok 表现挣扎,而 Claude 尽管成本更高却表现不佳。
暂无内容
查看缓存全文
缓存时间:
2026/07/21 21:40
# 用 GPT-5.6、Claude、Gemini 和 Grok "绘制"蒙娜丽莎
来源:https://www.tryai.dev/blog/ai-drawing-arena-colored-pencils-claude-gpt-grok
我们搭建了一个绘图竞技场:交给模型一张空白画布和一套彩色铅笔工具,然后静观其变。模型可以设置颜色、笔尖宽度和压力,批量绘制笔触,涂抹混合,擦除,并通过 view_canvas 查看自己的作品,决定下一步修改。它要么临摹目标图像,要么根据文字提示作画。
我们让四个视觉模型——GPT-5.6 Sol (https://www.tryai.dev/models/gpt-5.6-sol)、Claude Fable 5 (https://www.tryai.dev/models/claude-fable-5)、Grok 4.5 (https://www.tryai.dev/models/grok-4.5) 和 Gemini 3.6 Flash (https://www.tryai.dev/models/gemini-3.6-flash)——完成了两个目标临摹任务(蒙娜丽莎和梵高的《星夜》,均进行客观评分)和五个开放式提示项,共计 28 幅画作。我们将介绍工具使用、成本、输出结果,以及模型是否真正改进了自己的作品,并附上我们的评价。
## 为什么我们要做这件事
简单说明一下我们这么做的原因,因为我们上次的类似实验(https://www.tryai.dev/blog/ai-music-video-arena-claude-vs-gpt-5.6)(模型制作音乐视频)引发了一场不错的讨论(https://news.ycombinator.com/item?id=48939524),有些人认为我们是在宣传模型的创造力或艺术能力。这些并不是对模型能力的客观测试。它们刻意设计成开放式、模糊的任务。以下是个人持续做这些测试的原因:
- **它们很有趣,而且确实能提供信息。**观察模型处理一个松散、开放式任务,比又一个基准测试数字更能直观地显示其能力。
- **它们揭示了前沿模型与开源模型之间的差距。**成本更低的开源权重模型在许多执行任务上完全可以替代前沿模型,我们会持续报道这一点。但市面上也存在大量刷榜现象,而像这样的任务能突破这些表象,真正区分出前沿模型与其余模型的实力。正如你将看到的,Grok 4.5 在这个"基础"绘图任务上表现糟糕,而我们尝试的开源权重模型甚至无法使用,有几个直接返回了空白画布。(这种情况在 Kimi K3 完全开源后可能会改变,届时我们会进行报道。)
- **它们展示了长时间运行任务的实际成本。**Claude Fable 5 几乎总是比其他模型花费更长的时间、更多的费用,而在这里产出的结果却更差。Fable 在很多任务上曾胜过 GPT-5.6,包括音乐视频挑战(https://www.tryai.dev/blog/ai-music-video-arena-claude-vs-gpt-5.6),但在这次任务中,它表现更差,开销却大得多。根据你的用例,这种权衡很重要。
- **我们喜欢这些讨论。**讨论确实非常有趣,如果你对实验设置或新任务有建议,我们会考虑采纳。运行这些测试非常有趣,看到输出结果也令人兴奋。
每个模型都使用完全相同的彩色铅笔工具集:
- **plan**:一个无操作草稿本,用于在步骤之间思考和规划。
- **view_target**:再次查看目标图像。
- **view_canvas**:渲染当前页面并查看。此时我们也会根据目标对画作进行评分。
- **set_color**/**set_brush**/**set_pressure**:设置当前铅笔的颜色、笔尖宽度和压力(透明度 0 到 1,低压力用于更柔和的色调)。
- **draw**:一次调用绘制一批标记(笔触、线条、形状轮廓、点)。没有实心填充,色调和颜色通过分层构建,就像真正的铅笔一样。
- **smudge**:涂抹/柔化一个矩形区域,就像使用擦笔。
- **erase**/**clear_canvas**:将某个区域恢复为白色 / 重设整个页面。
整个工具框架是开源的,位于 github.com/hershalb/canvas-arena(https://github.com/hershalb/canvas-arena)。你可以将其指向任何目标图像或文本提示,自行运行。
## 两个目标临摹任务
模型可以全程看到目标图像,并根据与目标图像的结构相似性(SSIM)进行评分。下面列出了 SSIM 得分。
蒙娜丽莎(目标)GPT-5.6 SolClaude Fable 5Grok 4.5Gemini 3.6 Flash完整日志:GPT-5.6 Sol (https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/mona-lisa-sol.txt)·Claude Fable 5 (https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/mona-lisa-fable.txt)·Grok 4.5 (https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/mona-lisa-grok.txt)·Gemini 3.6 Flash (https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/mona-lisa-gemini.txt)
星夜(目标)GPT-5.6 SolClaude Fable 5Grok 4.5Gemini 3.6 Flash完整日志:GPT-5.6 Sol (https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/starry-night-sol.txt)·Claude Fable 5 (https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/starry-night-fable.txt)·Grok 4.5 (https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/starry-night-grok.txt)·Gemini 3.6 Flash (https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/starry-night-gemini.txt)
## 五个提示画作
没有目标,没有评分,只有文字简述和一张白页。
**"一位年迈渔民饱经风霜的面孔,温暖傍晚的阳光,深深的皱纹和胡茬"**
GPT-5.6 SolClaude Fable 5Grok 4.5Gemini 3.6 Flash完整日志:GPT-5.6 Sol (https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/fisherman-sol.txt)·Claude Fable 5 (https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/fisherman-fable.txt)·Grok 4.5 (https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/fisherman-grok.txt)·Gemini 3.6 Flash (https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/fisherman-gemini.txt)
**"宁静海洋上的美丽日落,橙紫渐变天空,剪影般的水平线"**
GPT-5.6 SolClaude Fable 5Grok 4.5Gemini 3.6 Flash完整日志:GPT-5.6 Sol (https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/sunset-sol.txt)·Claude Fable 5 (https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/sunset-fable.txt)·Grok 4.5 (https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/sunset-grok.txt)·Gemini 3.6 Flash (https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/sunset-gemini.txt)
**"暗色背景中一个玻璃花瓶里的单枝红玫瑰,戏剧性的伦勃朗式布光"**
GPT-5.6 SolClaude Fable 5Grok 4.5Gemini 3.6 Flash完整日志:GPT-5.6 Sol (https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/rose-sol.txt)·Claude Fable 5 (https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/rose-fable.txt)·Grok 4.5 (https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/rose-grok.txt)·Gemini 3.6 Flash (https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/rose-gemini.txt)
**"一只虎斑猫蜷缩在午后阳光下的窗台上睡觉"**
GPT-5.6 SolClaude Fable 5Grok 4.5Gemini 3.6 Flash完整日志:GPT-5.6 Sol (https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/cat-sol.txt)·Claude Fable 5 (https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/cat-fable.txt)·Grok 4.5 (https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/cat-grok.txt)·Gemini 3.6 Flash (https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/cat-gemini.txt)
**"一个温馨的小木屋内部,有燃烧的壁炉,温暖的琥珀色光线和柔和的阴影"**
GPT-5.6 SolClaude Fable 5Grok 4.5Gemini 3.6 Flash完整日志:GPT-5.6 Sol (https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/cabin-sol.txt)·Claude Fable 5 (https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/cabin-fable.txt)·Grok 4.5 (https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/cabin-grok.txt)·Gemini 3.6 Flash (https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/cabin-gemini.txt)
## 关键数据概览
每个模型七幅画作的平均值和总计。
| 模型 | 工具调用次数 | 平均用时 | 总 Token 数 | 预估成本 | 平均 SSIM | 总步骤数 |
|------|------------|---------|-------------|---------|----------|---------|
| GPT-5.6 Sol | 7,296 | 2.6 分钟 | 3.4M | $7.74 | 6.0% | 116 |
| Claude Fable 5 | 7,541 | 12.5 分钟 | 14.6M | $160.58 | 15.6% | 207 |
| Grok 4.5 | 7,994 | 4.8 分钟 | 34.0M | $9.21 | 4.3% | 354 |
| Gemini 3.6 Flash | 7,736 | 6.9 分钟 | 27.7M | $12.87 | 22.6% | 190 |
四个模型使用完全相同的工具集,但方式截然不同。
- **GPT-5.6 Sol 从未调用过一次 set_color、set_brush 或 set_pressure**,它将这些参数内联在每次 draw 调用中,因此其调用几乎全是 draw、smudge 和 view_canvas。
- **Grok 4.5 则相反**:其 1,349 次工具调用中有 65% 是 set_color / set_brush / set_pressure,这导致它每幅画平均需要 99 个步骤。
- **Claude Fable 5** 依赖 smudge(123 次调用)并频繁审查。
- **Gemini 3.6 Flash** 是审查最频繁的,近三分之一的调用是 view_canvas(每幅画约 23 次自我审查),和 Sol 一样从未触及 set_* 工具。
## 成本和 Token 数
**Claude Fable 5 的七幅画作预估成本为 160 美元,大约是 GPT-5.6 Sol(7.74 美元)、Grok 4.5(9.21 美元)或 Gemini 3.6 Flash(12.87 美元)的 20 倍。** 这现在应该不算意外了。Grok 使用的 Token 数最多(34M),但由于约 98% 是缓存的读取,输入费率极低,加上 Grok 的费率是四个模型中最低的,因此成本保持低廉。Gemini 也严重依赖缓存读取,所以即使 Token 数达到 27.7M,成本也还算适中。
## 模型实际上是否改进了?
每次 view_canvas 都会根据目标重新对画布评分,因此我们可以观察运行过程中的进展。两个目标都呈现出两种模式:
第一,**它们很早就达到平台期。** Claude Fable 5 审阅了 27 次蒙娜丽莎,但相似度在大约第五次审阅后就基本持平。第二,**在所有八次目标运行中,最终画作的得分都低于模型在运行中期达到的最高分。** GPT-5.6 Sol 的蒙娜丽莎最高 SSIM 为 0.352,最终为 0.325;其《星夜》最高为 0.179,最终为 0.130。Gemini 3.6 Flash 审查次数最多(每幅画约 23 次),并达到了整个批次中的最高峰值,蒙娜丽莎 0.449,但最终滑落至 0.337。更多的审查并未带来更好的最终结果。这些模型不断修改,甚至越过了自己的最佳表现。
## 客观相似度(目标运行)
SSIM 取值范围 0 到 1,越高越接近目标。RMSE 取值范围 0 到 255,越低越接近目标。
| 模型 | 目标 | 用时 | 步骤数 | 最终 SSIM | 峰值 SSIM | 最终 RMSE |
|------|------|------|-------|----------|----------|----------|
| GPT-5.6 Sol | 蒙娜丽莎 | 448m41s | 70 | 0.325 | 0.352 | 54.2 |
| Claude Fable 5 | 蒙娜丽莎 | 8618m58s | 27 | 0.286 | 0.289 | 56.9 |
| Grok 4.5 | 蒙娜丽莎 | 1064m30s | 5 | 0.151 | 0.152 | 95.6 |
| Gemini 3.6 Flash | 蒙娜丽莎 | 605m31s | 22 | 0.337 | 0.449 | 51.1 |
| GPT-5.6 Sol | 星夜 | 235m47s | 4 | 0.130 | 0.179 | 37.8 |
| Claude Fable 5 | 星夜 | 4311m30s | 12 | 0.153 | 0.176 | 40.9 |
| Grok 4.5 | 星夜 | 585m51s | 3 | 0.039 | 0.039 | 104.9 |
| Gemini 3.6 Flash | 星夜 | 746m36s | 24 | 0.172 | 0.190 | 42.8 |
从原始 SSIM 来看,Gemini 3.6 Flash 在两个目标上得分最高,无论是最终分数还是峰值分数,尽管它在其最佳帧和最终帧之间的波动也最大。Gemini 3.6 Flash 看起来不错,但肯定不是最接近目标输出的。有趣的是,原始分数却更高。一如既往,SSIM 衡量的是结构上的接近程度,而非画作对人眼的效果(请参阅下方我们的看法)。
## 方法说明
- 四个模型,两个评分目标加五个提示项,共 28 幅画作。所有运行使用相同的彩色铅笔工具集。每个模型均将推理设置为高。
- SSIM/RMSE 通过将两幅图像调整至 256x256 进行比较来计算。它们衡量结构/像素的接近程度,而非艺术质量,且仅适用于目标运行(提示项无参考图像可供评分)。
- 挂钟时间包括模型自身的思考和工具往返时间。
## 我们的看法
GPT-5.6 Sol 是无可争议的领跑者。它的《星夜》和玫瑰是我们整个批次中的最爱,考虑到它是在空白画布上一笔一笔画出来的,这真是太厉害了。它在几乎所有画作的细节上都击败了其他两个模型,唯一的例外是那位年迈渔夫。
Grok 4.5 在这里基本就是垃圾。它几乎产不出任何可用的东西,尽管它频繁使用工具,但我目前还不会信任它能可靠地理解或判断视觉输出。
Gemini 3.6 Flash 肯定比 Grok 好,但成本略有增加,不过将 Flash 模型与前沿版本比较似乎有些不公平。我当然很期待看到 Gemini 4 的表现。我们之前也知道这点,但其 Token 输出速度确实令人印象深刻。
Claude Fable 5 在质量上排在第二,但成本和时间却是最高的。对于这个任务,它是三者中最不划算的选择:速度慢得多、价格贵得多(大约是其他的 20 倍),而输出却跟不上 Sol。
相似文章
Hacker News Top
对十二个AI模型的详细比较,包括GPT-5.6、Grok 4.5、Claude以及开放权重模型,被要求多次尝试构建四个不同的应用程序,所有成果均已公开以供独立评估。
Reddit r/singularity
本文对 Grok 4.5、GPT-5.5、Claude Opus 4.8 和 Claude Fable 5 进行了基准测试,让每个模型根据单一提示构建三个交互式应用(3D 魔方、粒子重力沙箱、打砖块游戏),比较它们的一次性编码能力。
Hacker News Top
一项实验让Claude Fable 5与GPT-5.6 Sol在预算内自主制作音乐视频,每个模型均使用工具进行研究、生成片段和编辑。结果显示不同的策略和质量,其中Claude Fable 5在100美元预算下生成了更高分辨率的输出。
Reddit r/ArtificialInteligence
对GPT-5.5、Claude Opus 4.7、Gemini 3.1 Pro和DeepSeek V4 Pro的基准测试分析表明,没有单一模型在所有任务上占据优势;要实现最佳性能,需要采用多模型路由器,根据各模型的优势与弱点进行专门化使用。
Hacker News Top
JuliaHub 在五个物理建模问题上对 GPT-5.6 和 Claude Fable 5 进行了测试。Claude Fable 5 以 0.889 的加权得分名列前茅,而 GPT-5.6 的变体得分较低,但更便宜且速度更快。