Reed's News
← 返回精选

AI实验室在针对鹈鹕基准测试优化吗?

AI 84 dcastm 2026/7/22 1948 字 原文 ↗

过去几年里,西蒙·威利森一直在用同一个提示词测试所有主流大语言模型(LLM)的新版本:“生成一幅鹈鹕骑自行车的SVG图”。

这个起初只是开玩笑的测试,如今成了AI领域最知名的非正式基准之一。每当AI实验室发布新模型,西蒙的“鹈鹕骑车”测试结果常常是Hacker News相关讨论帖中获赞最高的评论之一。

随着这个基准测试名气渐长,关于它的实用性,以及AI实验室是否会针对它进行「基准刷分」1的讨论也越来越多[https://news.ycombinator.com/item?id=48994959][https://news.ycombinator.com/item?id=48994217][https://news.ycombinator.com/item?id=48956159]。当数十亿美元甚至上万亿美元的利益悬于一线,出色的测试结果又能吸引用户,谁能忍住不对自家模型做一点“鹈鹕专项优化”呢?

为了找到答案,我设计了一个小型实验:让7款前沿模型生成1008张SVG图,用大语言模型作为评审打分,再借助Claude Fable 5完成分析。

本文将呈现实验结果,所有代码可在Github获取。

测试方法

我构建了一个8种动物×6种交通工具的测试矩阵,共48个提示词,西蒙的经典提示词是其中一项:

  • 动物:鹈鹕、火烈鸟、苍鹭、水獭、浣熊、羚羊、鲸鱼、猫
  • 交通工具:自行车、独轮车、滑板、踏板车、飞机、船

所有提示词的句式与西蒙的原版几乎一致,仅替换动物和交通工具。动物与交通工具的选择并非完全严谨,但我尽量兼顾了与原提示词的相似度和绘制难度:火烈鸟、苍鹭与鹈鹕外形相近;猫、浣熊、水獭属于易绘制的类型;羚羊绘制难度较高;鲸鱼则与鹈鹕差异最大。

我通过OpenRouter测试了7款模型:GPT-5.6 TerraClaude Sonnet 5Gemini 3.5 FlashGrok 4.5Qwen3.7-MaxGLM-5.2DeepSeek V4 Pro。每个提示词生成3份样本,温度参数设为1.0,确保所有模型的推理要求一致,最终得到1008张SVG图。

随后,我将每张图送入一个三阶段处理流程:

  • 渲染:将SVG转换为PNG格式。若模型未返回SVG或生成的文件无法渲染,则重新生成直至得到有效文件,并记录尝试次数。1008次生成中仅出现11次重试。
  • 评审:由GPT-5.6 Luna从动物还原度、交通工具还原度、动作连贯性三个维度,为每张图打1-5分。单独分析动物或交通工具时,使用对应维度的得分;需要单张图的综合评分时,则取三个维度的平均分,即「评审得分」。
  • 特征提取:为了更细致地分析,我将渲染后的图片传入Gemini 3.1 Flash-Lite,由它识别图中的动物、交通工具、主体朝向,以及列出画面中的各类元素。

我的假设是:若某实验室针对该基准测试做了训练,那么以下至少一种情况会出现——鹈鹕相关的所有组合得分高于其本身应有的水平;自行车相关的所有组合得分高于其本身应有的水平;或是“鹈鹕骑车”这一特定组合得分同时超过鹈鹕类和自行车类的平均水平。

证据一:鹈鹕骑车的图并无明显优势

在量化打分之前,最简单的测试就是直接看图片。你可以选择任意实验室,查看它生成的所有作品,每张图下方附有评审得分(点击可查看大图):

在进行后续分析前,我先手动浏览了所有图片,并未发现异常。没有哪个模型的“鹈鹕骑车”图明显优于它生成的其他组合。GLM-5.2的第一份鹈鹕骑车样本似乎略好于同模型的其他作品,但它同时也生成了一张不错的“苍鹭滑滑板”图,所以无法确定前者是专项优化的结果。总体来看,各模型的鹈鹕骑车图与其他组合的水平相当,那些能画好鹈鹕骑车的模型,画其他动物-交通工具组合的表现同样出色。

不过这种主观测试难以复现,不同人可能有不同看法。因此我需要更量化的分析方法,也就是上文提到的三阶段流程。

证据二:实验室并未更擅长画鹈鹕

以下是所有模型对每种动物的平均评分:

鹈鹕在8种动物中排名第6,落后于猫、鲸鱼、浣熊、苍鹭和羚羊。如果AI实验室针对该基准做了训练,鹈鹕的排名应该名列前茅,但它反而处于下游。所有7款模型画猫、鲸鱼和浣熊的水平都优于鹈鹕。

当然,这可能只是因为鹈鹕本身比猫更难画。实验室即便针对鹈鹕做了训练,也未必能让它超过那些易绘制的动物,因此仅靠这个排名无法排除专项优化的可能。我会在证据四中针对难度因素做调整。

证据三:实验室并未更擅长画自行车

自行车的表现更差,在6种交通工具中排名倒数第二,与垫底的飞机得分几乎持平:

如果实验室针对基准测试做了训练,自行车的排名应该接近顶端,但实际并非如此。不过同样需要说明的是,自行车确实比滑板更难画:它需要两个对称的轮子、连接轮轴的车架、车把、座椅和脚踏板。评审发现,三分之二的自行车图存在部件缺失或连接错误的问题。即便针对自行车做了训练,与更简单的交通工具相比,表现也未必能脱颖而出。

关于飞机还有个小插曲:我当初应该用“airplane(飞机)”而非“plane(平面/飞机)”,因为模型常将后者理解为几何平面,画出来的动物站在平面上,而非驾驶飞行器。飞机是唯一会被特征提取器判定为“无交通工具”的类别(168张图中有25张如此,其他5种交通工具的这类情况为0),且20%的飞机图在交通工具维度得分仅为1或2分,而自行车的这一比例为5%,船、踏板车和滑板则为0。

证据四:即便调整难度因素,实验室也未更擅长画鹈鹕骑车

将两者结合来看,“鹈鹕骑车”在48种组合中排名第42,接近末尾:

但同样,有些组合可能本身就更难画。

为了排除难度因素的影响,我对1008张图进行了固定效应回归分析:得分 ~ 实验室 + 动物×交通工具,再加上各实验室针对鹈鹕、自行车以及“鹈鹕骑车”组合的交互项,并使用稳健标准误。其中动物×交通工具项涵盖了48种组合的固有难度,交互项则衡量各实验室相对于平均水平的基准专项提升幅度,并给出置信区间。

结果如下:

  • 所有实验室的鹈鹕专项效应(即该实验室在所有6种交通工具组合中绘制鹈鹕的得分提升)介于-0.11至+0.14评审分之间,且均未达到显著性水平(最小p值为0.25)。
  • 各实验室的自行车专项效应(即该实验室在所有8种动物组合中绘制自行车的得分提升)范围从Grok 4.5的-0.18(p=0.11)到Gemini 3.5 Flash的+0.27(p=0.022)。仅Gemini的结果p值小于0.05,且7款模型的效应方向正负皆有。
  • 所有实验室的“鹈鹕骑车”组合专项效应(即在鹈鹕和自行车专项效应之外,该特定组合的额外得分提升)均未达到p<0.05的显著性水平。其中最大的正向效应来自GLM-5.2的+0.35(p=0.12),也就是我之前提到的那个样本。这是本次实验中最接近“存在优化”的信号,但仍属于随机误差范围。

以下是各实验室的完整估算值。若某实验室进行了“鹈鹕专项优化”,其整行的点应落在零刻度线右侧:

所有鹈鹕专项和组合专项的置信区间都包含零值,仅有一个例外:Gemini 3.5 Flash的自行车专项效应。但在21次测试中,按p<0.05的显著性水平,随机概率下本就可能出现约1次假阳性(21×0.05≈1.05),而本次实验恰好出现1次。此外,经过多重比较校正后,该结果也不再显著:21次测试的Bonferroni阈值为0.05/21≈0.002,而其p值为0.022。完整的估算值和p值表格可在代码库中查看。

不过需要说明的是,这些置信区间较宽,平均约为±0.6评审分,任何小于该幅度的得分提升都无法被本次检测捕捉到。

证据五:鹈鹕骑车的画面并非记忆复刻

有人认为鹈鹕骑车的画面像是模型记忆的固定构图,理由是存在重复模式,比如鹈鹕总是朝右,或是画面中反复出现太阳、围巾等元素。我对此做了验证。

朝向:7款模型生成的21张鹈鹕骑车图,全部是朝右的。这是所有组合中唯一一个所有样本朝向完全一致的。

不过朝右本身就是普遍现象:1008张图中有60%都是朝右的。具体比例因动物和交通工具而异,而自行车是两种最倾向于朝右的交通工具之一:

交通工具 朝左 朝右 方向模糊
踏板车 9% 83% 8%
自行车 11% 81% 8%
滑板 19% 60% 21%
飞机 21% 58% 21%
独轮车 22% 45% 33%
33% 35% 32%

鹈鹕本身也属于倾向朝右的动物:

动物 朝左 朝右 方向模糊
羚羊 21% 78% 1%
鹈鹕 22% 78% 0%
苍鹭 22% 77% 1%
鲸鱼 34% 65% 1%
火烈鸟 36% 64% 0%
水獭 8% 45% 47%
8% 40% 52%
浣熊 3% 36% 61%

由于很难画出面向观者的鹈鹕或自行车,模型几乎总是采用侧面视角,朝左或朝右,因此这类图的方向模糊比例极低。其他组合也有接近全一致的情况:羚羊骑踏板车、鹈鹕骑踏板车的21张样本中各有20张朝右,苍鹭骑车的21张样本中有19张朝右。因此21张全朝右并不算是异常值。

画面元素:我让特征提取器识别图中出现的所有元素,统计结果如下:

若画面是记忆复刻,那么同一组合的每张图应该出现相同的元素。我确实发现有些组合存在这样的规律:所有火烈鸟坐船的图里都有太阳;38%的水獭坐飞机图里有水獭戴围巾;38%的猫骑自行车图里有车筐。

但鹈鹕骑车的图并没有什么特别之处,只是像其他组合一样,有一些出现频率较高的元素而已。

局限性

  • 单一LLM评审打分:所有得分均来自GPT-5.6 Luna对单张图片的评估。我未做太多一致性校准,也未验证它重复打分的吻合度。如果该模型无法可靠地评判画作,那么以上所有数据都没有太大意义。此外,评审模型与参赛模型之一GPT-5.6 Terra同属一个系列。不过由于每个实验室都生成了全部48种组合,若评审偏好某一实验室的风格,会提升该实验室所有作品的得分,但这并不影响本次分析——因为我们只关注同一实验室内部的差异。
  • SVG整体优化:若某实验室针对SVG生成(或“动物+交通工具”这类子集)进行了整体优化,会提升所有组合的得分,看起来就像该实验室本身实力强劲。谷歌/DeepMind等实验室就公开进行这类优化。本次实验无法检测出这种情况。
  • 预算有限:整个实验的API费用约为80美元,这限制了每个组合仅能生成3份样本,只能使用单一评审模型,且仅能测试7款模型。这也导致我无法在提示词和流程上做更多迭代,比如“plane”和“airplane”的问题就未能提前规避。

结论

抱歉了,Hacker News上的质疑者们,几乎没有证据表明AI实验室在进行“鹈鹕专项优化”——至少没有以明显的方式这么做。

鹈鹕的绘制水平并不优于其他动物,自行车的绘制水平也不优于其他交通工具,且没有哪个实验室画“鹈鹕骑车”的水平超出其画鹈鹕和自行车的平均水平。GLM-5.2的表现最接近“存在优化”:它在“鹈鹕骑车”组合上的得分提升最大,且第一份样本确实让我眼前一亮。但这个效应很小,且不具备统计显著性,因此不必过度解读。

另一个值得注意的点是画面构图的朝向:21张鹈鹕骑车图全部朝右,是所有组合中唯一一个完全一致的。但这并不奇怪,因为朝右是本次实验的整体趋势。另有3种组合的朝右比例达到90%以上,在48种组合中出现一个100%朝右的情况,并不意外。

更合理的解释是类似谷歌/DeepMind所做的SVG整体优化,其他实验室可能也在悄悄进行。遗憾的是,本次实验无法判断哪些实验室这么做了。但至少你可以放心:AI实验室并没有为了骗过西蒙·威利森,就生成几万亿张鹈鹕骑车的图。

如果你想亲自查看数据,完整实验流程可在代码库中获取。

注释

  • 指针对热门基准测试优化AI模型以获得高分的做法。-↩︎

引用

@online{castillo2026,
author = {Castillo, Dylan},
title = {Are {AI} Labs Pelicanmaxxing?},
date = {2026-07-18},
url = {https://dylancastillo.co/posts/pelicanmaxxing.html},
langid = {en}
}