Are AI Labs Pelicanmaxxing?

Hacker News Top 新闻

摘要

一项分析调查了AI实验室是否在针对流行的‘骑自行车的鹈鹕’SVG基准测试优化其模型,该测试在48个提示中测试了七个前沿模型,使用不同的动物和车辆,未发现过拟合的强有力证据。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/07/22 20:23

# AI 实验室在搞“鹈鹕优化”吗? – Dylan Castillo 原文链接:https://dylancastillo.co/posts/pelicanmaxxing.html 过去几年里,Simon Willison (https://simonwillison.net/tags/pelican-riding-a-bicycle/) 每次测试主流大语言模型的新版本时,都会用同一个提示词:“生成一个骑自行车的鹈鹕的 SVG”。 这个起初只是半开玩笑的测试,如今已成为 AI 领域最著名的非正式基准之一。在 Hacker News 上宣布新模型发布的帖子里,Simon 的“鹈鹕骑自行车”测试结果常常是获赞最多的评论之一。 这个基准如今名气大到引发了大量 (https://news.ycombinator.com/item?id=48994959) 关于 (https://news.ycombinator.com/item?id=48994217) 其有用性 (https://news.ycombinator.com/item?id=48956159) 的讨论,以及 AI 实验室是否可能针对它进行“基准优化”(benchmaxxing)¹ (https://dylancastillo.co/posts/pelicanmaxxing.html#fn1) 的猜测。当涉及数亿甚至数万亿美元的利益时,一个亮眼的结果有助于说服用户,实验室难道不会忍不住稍微“优化一下鹈鹕”吗? 我想一探究竟,于是设计了一个小实验。我生成了 1,008 张 SVG 图片,涵盖七个前沿模型,用 LLM 裁判打分,并使用 Claude Fable 5 进行分析。 本文展示实验结果。所有代码均可在 Github (https://github.com/dylanjcastillo/blog/tree/main/_extras/pelicanmaxxing) 上获取。 ## 我的测试方法 我构建了一个 8 种动物 × 6 种交通工具 = 48 个提示词的网格,其中最著名的提示词是其中的一个单元格: 1. **动物**:鹈鹕、火烈鸟、苍鹭、水獭、浣熊、羚羊、鲸鱼、猫 2. **交通工具**:自行车、独轮车、滑板、踏板车、飞机、船 每个提示词的表述几乎与 Simon 的完全一致,只替换动物和交通工具。动物和交通工具的选择并非十分严谨,但我试图在“与原提示词的相似度”和“难度”两个维度上进行变化。火烈鸟和苍鹭与鹈鹕非常相似;猫、浣熊和水獭是容易的案例;羚羊较难;而鲸鱼则是你能想到的最不相似的选项。 我通过 OpenRouter (https://openrouter.ai/) 测试了七个模型:*GPT-5.6 Terra*、*Claude Sonnet 5*、*Gemini 3.5 Flash*、*Grok 4.5*、*Qwen3.7-Max*、*GLM-5.2* 和 *DeepSeek V4 Pro*。每个提示词生成 3 个样本,温度设为 1.0,并请求每个模型采用相同的推理努力程度。最终生成了 1,008 张 SVG 图片。 然后,我对每张图片执行了一个三阶段流程: 1. **渲染**:将每个 SVG 渲染为 PNG。如果模型返回的 SVG 无效或无法渲染,我会重新生成,直到得到有效的 SVG,并记录尝试次数。在 1,008 次生成中,仅出现了 11 次重试。 2. **评判**:*GPT-5.6 Luna* 对每张图片的动物、交通工具以及动作连贯性分别给出 1-5 分的评分。下文单独排名动物或交通工具时,我会直接使用对应的评分。当需要一个图片综合分数时,我使用三项评分的平均值,称为“裁判分”。 3. **特征提取**:为了更详细的分析,我还将每张渲染后的图片传递给 *Gemini 3.1 Flash-Lite*,它记录了识别出的动物和交通工具、主体面对的方向,以及一个开放式的场景元素列表。 我的假设是:如果某个实验室针对这个基准进行了训练,那么应该会在以下某种组合中体现出来:鹈鹕行的得分高于动物应有的水平、自行车列的得分高于交通工具应有的水平,或者特定“鹈鹕-自行车”单元格的表现超过两者。 ## 证据 #1:鹈鹕骑自行车看上去并不更好 在任何评分之前,最简单的测试就是亲自看看这些图片。选择一个实验室,查看它生成的所有图片,裁判分显示在每张图片下方(点击可查看完整尺寸): 我在运行下面的分析之前,自己浏览了所有图片。没有任何图片特别突出。我没能发现任何案例表明某模型的“鹈鹕骑自行车”图片明显优于该模型网格中的其他图片。也许在 GLM-5.2 的第一个样本中,它看起来比其余图片稍好一些,但那一批也产出了一张相当酷的“苍鹭骑滑板车”,所以我不能肯定。除此之外,它们看起来与其他模型绘制的图片没什么区别,而那些能画好“鹈鹕骑自行车”的实验室,在处理其他动物-交通工具组合时也表现不错。 但这项测试难以重复,且每个人都会有不同看法。因此,我需要更量化的方法,这也是我选择上述方法的原因。 ## 证据 #2:实验室画鹈鹕并没有更好 以下是所有模型合并后,每种动物的平均动物评分: 图 1:所有模型合并后的平均动物评分(按动物分类)。 鹈鹕在 8 种动物中排名第 6,仅次于猫、鲸鱼、浣熊、苍鹭和羚羊。如果 AI 实验室针对这个基准进行了训练,你预期鹈鹕会排在前面。但事实恰恰相反,它排在倒数一半。所有七个实验室画猫、鲸鱼和浣熊都比画鹈鹕好。 当然,画一只鹈鹕可能本身就比画一只猫更难。实验室即使训练了鹈鹕,也可能无法让它超越那些容易画的动物,所以单凭这个排名无法排除这种可能性。我将在证据 #4 中通过调整难度来解决这个问题。 ## 证据 #3:实验室画自行车并没有更好 自行车的情况更糟。它排在倒数第二,与排在最后的飞机几乎持平: 图 2:所有模型合并后的平均交通工具评分(按交通工具分类)。 如果实验室针对这个基准进行了训练,你预期自行车会排在该排名的前列。但它没有。不过,同样的警告在这里也适用。自行车比滑板更难画:它需要两个匹配的轮子、一个连接两个轮轴的框架、车把、座椅和踏板。在 2/3 的自行车图片中,裁判发现了这些部件缺失或连接不当。你可以针对自行车图片进行训练,但相对于更简单的交通工具,你仍然可能画得不够好。 不过有一点关于飞机的说明:我应该用“airplane”而不是“plane”,因为模型经常从几何角度理解“plane”(平面)。它们画出的动物是站在一个平面上,而不是驾驶飞机。飞机是唯一一种特征提取器有时完全找不到交通工具的交通工具(168 张图片中有 25 张,而其他五种交通工具为零),并且 20% 的飞机图片在交通工具评分上只得到 1 或 2 分,而自行车只有 5%,船、踏板车或滑板则为 0%。 ## 证据 #4:即使调整了难度,实验室画鹈鹕骑自行车也没有更好 将两者结合起来,“鹈鹕骑自行车”在排名中接近底部,在 48 种组合中排第 42 位: 图 3:所有 48 种组合排名;鹈鹕+自行车高亮显示。 但同样,有些组合可能本身就比其他组合更难画。 为了说明这一点,我对所有 1,008 张图片拟合了一个固定效应回归模型:得分 ~ 实验室 + 动物 × 交通工具,再加上每个实验室针对鹈鹕、自行车以及鹈鹕-自行车单元格的交互项,使用稳健标准误。动物×交通工具项吸收了所有 48 种组合的固有难度。交互项衡量每个实验室相对于平均实验室的特定基准提升,并附有置信区间。 结果如下: 1. 每个实验室的鹈鹕效应(实验室在鹈鹕上(涵盖全部六种交通工具)的增益)介于 -0.11 到 +0.14 裁判分之间,且均不接近显著(最小 p = 0.25)。 2. 每个实验室的自行车效应(实验室在自行车上(涵盖全部八种动物)的增益)范围从 *Grok 4.5* 的 -0.18(p=0.11)到 *Gemini 3.5 Flash* 的 +0.27(p=0.022)。只有 Gemini 通过了 p < 0.05 的显著性检验,且七个效应的方向有正有负。 3. 没有哪个鹈鹕-自行车单元格效应(在实验室的鹈鹕和自行车效应之上,特定组合的*额外*增益)通过 p < 0.05 的显著性检验。最大的正向效应是 *GLM-5.2* 的 +0.35(p=0.12),这就是我之前提到的那个。这是本实验中最接近信号的结果,但仍然处于随机水平。 以下是每个实验室的完整估计值。如果存在“鹈鹕优化”的实验室,其整行的点应该显示在零线右侧: 图 4:每个实验室经难度调整后的效应,附 95% 置信区间。高亮区间排除了零。 每个鹈鹕区间和每个单元格区间都包含零。只有一个不包含零:*Gemini 3.5 Flash* 在自行车列上。但在 p < 0.05 的水平下进行 21 次检验,仅凭偶然概率预测会有一个假阳性(21 × 0.05 ≈ 1.05),而实际恰好出现了一个。并且它也无法通过多重比较校正:对这 21 次检验的 Bonferroni 阈值为 0.05/21 ≈ 0.002,而它的 p 值是 0.022。完整的估计值和 p 值表在仓库 (https://github.com/dylanjcastillo/blog/tree/main/_extras/pelicanmaxxing) 中。 但是,这些区间很宽,平均大约 ±0.6 个裁判分。任何小于此的增益都无法被本次测试捕捉。 ## 证据 #5:鹈鹕骑自行车的场景看起来并非机械记忆 有人提出,“鹈鹕骑自行车”看起来像一种机械记忆的构图,指出了一些重复出现的模式,比如鹈鹕总是面朝右,或者总是出现太阳、围巾等元素。所以我想知道这是否属实。 **方向**:所有七个实验室的 21 张“鹈鹕骑自行车”图片,都是面朝右的。没有其他动物/交通工具组合是这样。 然而,面朝右很常见:全部 1,008 张图片中有 60% 都是如此。常见程度取决于动物和交通工具,自行车是方向性最强的两种交通工具之一: | 交通工具 | 左 | 右 | 模糊 | | :--- | :--- | :--- | :--- | | 踏板车 | 9% | 83% | 8% | | 自行车 | 11% | 81% | 8% | | 滑板 | 19% | 60% | 21% | | 飞机 | 21% | 58% | 21% | | 独轮车 | 22% | 45% | 33% | | 船 | 33% | 35% | 32% | 鹈鹕也是倾向于面朝右的动物之一: | 动物 | 左 | 右 | 模糊 | | :--- | :--- | :--- | :--- | | 羚羊 | 21% | 78% | 1% | | 鹈鹕 | 22% | 78% | 0% | | 苍鹭 | 22% | 77% | 1% | | 鲸鱼 | 34% | 65% | 1% | | 火烈鸟 | 36% | 64% | 0% | | 水獭 | 8% | 45% | 47% | | 猫 | 8% | 40% | 52% | | 浣熊 | 3% | 36% | 61% | 画一个面向观众方向的鹈鹕或自行车很困难,所以模型几乎总是从侧面画它们,面朝左或右。这就是为什么它们的图片很少出现模糊方向。其他一些组合也接近完全一致:羚羊骑踏板车和鹈鹕骑踏板车都是 21 张中有 20 张面朝右,苍鹭骑自行车是 21 张中有 19 张。所以 21 张全部面朝右似乎并不算异常。 **场景元素**:我让特征提取器指出它在图片中看到的任何元素。以下是计数结果: 图 5:从开放式元素提取中获得的包含每个元素的图片占比。 一个机械记忆的场景会表现为相同的一组元素在每一张图片中重复出现。我对此进行了查找,发现某些组合确实每次都倾向于生成相同的元素。每一张“火烈鸟坐船”图片中都有太阳。38% 的“水獭开飞机”图片中戴了围巾。38% 的“猫骑自行车”图片中有一个篮子。 “鹈鹕骑自行车”似乎并没有特别不同之处。它只是像其他每种动物-交通工具组合一样,某些元素出现得更频繁。 ## 局限性 1. **使用单一 LLM 裁判进行评分。** 这里的每一个分数都来自一个模型 *GPT-5.6 Luna*,每次只看一张图片。我没有进行太多对齐检查,也没有检查它在重复运行时与自己的一致性。如果一个模型不能可靠地评判一张图画,那么以上所有数字的意义都不大。此外,该裁判与参赛者之一 *GPT-5.6 Terra* 属于同一模型家族。然而,每个实验室都画了全部 48 种组合,所以如果裁判碰巧喜欢某个实验室的风格,它会一下子提升该实验室整个网格的分数。但这不会改变结果,因为本分析只关心实验室内部(不同组合间)的差异。 2. **SVG 全面优化 (SVGmaxxing)。** 如果一个实验室优化了 SVG 生成*整体*(或某个子集,如动物骑交通工具),那么它的每一个单元格的分数都会同时提升,看起来就像一个本来就画得好的实验室。有些实验室,如 Google/DeepMind,公开 (https://x.com/JeffDean/status/2024525132266688757) 就是这么做的。本实验无法检测到这种情况。 3. **预算有限。** 整个实验大约花费了 80 美元的 API 额度。这限制了我只能对每个单元格生成 3 个样本,使用单一裁判和 7 个模型。这也阻止了我对提示词和流程进行大量迭代,比如“plane”与“airplane”的问题。 ## 结论 抱歉,Hacker News 的批评者们,但几乎没有证据表明 AI 实验室在进行“鹈鹕优化”。至少他们没有以显而易见的方式这么做。 鹈鹕并没有比其他动物画得更好。自行车并没有比其他交通工具画得更好。也没有哪个实验室画“鹈鹕骑自行车”组合比它本身的鹈鹕和自行车水平所预示的更好。GLM-5.2 最接近:它对鹈鹕-自行车特定单元格的增益最大,而且它的第一张“鹈鹕骑自行车”样本确实引起了我的注意。但效应很小且不显著,所以我不应过分看重。 另一个值得注意的点是场景构图中的方向。所有 21 张“鹈鹕骑自行车”图片都面朝右,这是网格中唯一一个所有图片方向都一致组合。但这似乎并不奇怪。面朝右是整个实验中的常态。另外三个组合也达到了 90% 或以上的方向一致性,而且在 48 个组合中,出现一个 21/21 的情况我并不意外。 更合理的解释是像 Google/DeepMind 那样进行 SVG 全面优化。其他实验室可能也在更低调地进行这类优化。遗憾的是,本实验无法判断谁在这么做。但至少你今晚可以安心入睡,知道 AI 实验室并没有为了骗过 Simon Willison 而生成数 TB 的“鹈鹕骑自行车”图片。 如果你想亲自查看数据,完整的流程都在仓库 (https://github.com/dylanjcastillo/blog/tree/main/_extras/pelicanmaxxing) 中。 ## 脚注 1. 优化 AI 模型以在流行基准上获得高分的做法。↩︎ (https://dylancastillo.co/posts/pelicanmaxxing.html#fnref1) ## 引用 BibTeX 引用格式: `` @online{castillo2026, author = {Castillo, Dylan}, title = {Are {AI} Labs Pelicanmaxxing?}, date = {2026-07-18}, url = {https://dylancastillo.co/posts/pelicanmaxxing.html}, langid = {en} } `` 如需注明出处,请引用本作品: Castillo, Dylan. 2026.“Are AI Labs Pelicanmaxxing?”July 18. https://dylancastillo.co/posts/pelicanmaxxing.html.

相似文章

@apivixtls: 这篇文章看完后,我真正注意到的点不是比哪个模型更厉害。作者拿AI跑了一圈实际的安全研究测试。Semgrep直接没找到。Strix接GLM 5.1跑了12小时,花了接近6000万tokens,还是没抓到关键漏洞。Cursor配GPT 5.5…

X AI KOLs Timeline

A security researcher tested four AI approaches (Semgrep, GLM 5.1+Strix, Cursor+GPT 5.5, local AI with custom harness) to find a known LFI vulnerability in PHPIPAM. Only the local AI harness consistently succeeded, demonstrating that the harness methodology matters more than the model, and highlighting advantages of local AI for cost, privacy, and flexibility in security research.

@OkhayIea: 每个人都在竞相构建“AI科学家”。因此我们提出了一个直白的问题:当今最好的编码代理能打败公开发表的…

X AI KOLs Timeline

介绍了NatureBench,这是一个跨学科基准测试,包含来自Nature论文的90个任务,用于测试AI编码代理。研究发现,最好的代理(Claude Opus 4.7)仅在17.8%的任务上超越了现有最佳水平,而且其成功往往是通过将科学简化为监督式机器学习,而非真正的发现来实现的。