AI实验室在针对鹈鹕基准测试优化吗?
过去几年里,西蒙·威利森一直在用同一个提示词测试所有主流大语言模型(LLM)的新版本:“生成一幅鹈鹕骑自行车的SVG图”。
这个起初只是开玩笑的测试,如今成了AI领域最知名的非正式基准之一。每当AI实验室发布新模型,西蒙的“鹈鹕骑车”测试结果常常是Hacker News相关讨论帖中获赞最高的评论之一。
随着这个基准测试名气渐长,关于它的实用性,以及AI实验室是否会针对它进行「基准刷分」1的讨论也越来越多[https://news.ycombinator.com/item?id=48994959][https://news.ycombinator.com/item?id=48994217][https://news.ycombinator.com/item?id=48956159]。当数十亿美元甚至上万亿美元的利益悬于一线,出色的测试结果又能吸引用户,谁能忍住不对自家模型做一点“鹈鹕专项优化”呢?
为了找到答案,我设计了一个小型实验:让7款前沿模型生成1008张SVG图,用大语言模型作为评审打分,再借助Claude Fable 5完成分析。
本文将呈现实验结果,所有代码可在Github获取。
测试方法
我构建了一个8种动物×6种交通工具的测试矩阵,共48个提示词,西蒙的经典提示词是其中一项:
- 动物:鹈鹕、火烈鸟、苍鹭、水獭、浣熊、羚羊、鲸鱼、猫
- 交通工具:自行车、独轮车、滑板、踏板车、飞机、船
所有提示词的句式与西蒙的原版几乎一致,仅替换动物和交通工具。动物与交通工具的选择并非完全严谨,但我尽量兼顾了与原提示词的相似度和绘制难度:火烈鸟、苍鹭与鹈鹕外形相近;猫、浣熊、水獭属于易绘制的类型;羚羊绘制难度较高;鲸鱼则与鹈鹕差异最大。
我通过OpenRouter测试了7款模型:GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2和DeepSeek V4 Pro。每个提示词生成3份样本,温度参数设为1.0,确保所有模型的推理要求一致,最终得到1008张SVG图。
随后,我将每张图送入一个三阶段处理流程:
- 渲染:将SVG转换为PNG格式。若模型未返回SVG或生成的文件无法渲染,则重新生成直至得到有效文件,并记录尝试次数。1008次生成中仅出现11次重试。
- 评审:由GPT-5.6 Luna从动物还原度、交通工具还原度、动作连贯性三个维度,为每张图打1-5分。单独分析动物或交通工具时,使用对应维度的得分;需要单张图的综合评分时,则取三个维度的平均分,即「评审得分」。
- 特征提取:为了更细致地分析,我将渲染后的图片传入Gemini 3.1 Flash-Lite,由它识别图中的动物、交通工具、主体朝向,以及列出画面中的各类元素。
我的假设是:若某实验室针对该基准测试做了训练,那么以下至少一种情况会出现——鹈鹕相关的所有组合得分高于其本身应有的水平;自行车相关的所有组合得分高于其本身应有的水平;或是“鹈鹕骑车”这一特定组合得分同时超过鹈鹕类和自行车类的平均水平。
证据一:鹈鹕骑车的图并无明显优势
在量化打分之前,最简单的测试就是直接看图片。你可以选择任意实验室,查看它生成的所有作品,每张图下方附有评审得分(点击可查看大图):
在进行后续分析前,我先手动浏览了所有图片,并未发现异常。没有哪个模型的“鹈鹕骑车”图明显优于它生成的其他组合。GLM-5.2的第一份鹈鹕骑车样本似乎略好于同模型的其他作品,但它同时也生成了一张不错的“苍鹭滑滑板”图,所以无法确定前者是专项优化的结果。总体来看,各模型的鹈鹕骑车图与其他组合的水平相当,那些能画好鹈鹕骑车的模型,画其他动物-交通工具组合的表现同样出色。
不过这种主观测试难以复现,不同人可能有不同看法。因此我需要更量化的分析方法,也就是上文提到的三阶段流程。
证据二:实验室并未更擅长画鹈鹕
以下是所有模型对每种动物的平均评分:
鹈鹕在8种动物中排名第6,落后于猫、鲸鱼、浣熊、苍鹭和羚羊。如果AI实验室针对该基准做了训练,鹈鹕的排名应该名列前茅,但它反而处于下游。所有7款模型画猫、鲸鱼和浣熊的水平都优于鹈鹕。
当然,这可能只是因为鹈鹕本身比猫更难画。实验室即便针对鹈鹕做了训练,也未必能让它超过那些易绘制的动物,因此仅靠这个排名无法排除专项优化的可能。我会在证据四中针对难度因素做调整。
证据三:实验室并未更擅长画自行车
自行车的表现更差,在6种交通工具中排名倒数第二,与垫底的飞机得分几乎持平:
如果实验室针对基准测试做了训练,自行车的排名应该接近顶端,但实际并非如此。不过同样需要说明的是,自行车确实比滑板更难画:它需要两个对称的轮子、连接轮轴的车架、车把、座椅和脚踏板。评审发现,三分之二的自行车图存在部件缺失或连接错误的问题。即便针对自行车做了训练,与更简单的交通工具相比,表现也未必能脱颖而出。
关于飞机还有个小插曲:我当初应该用“airplane(飞机)”而非“plane(平面/飞机)”,因为模型常将后者理解为几何平面,画出来的动物站在平面上,而非驾驶飞行器。飞机是唯一会被特征提取器判定为“无交通工具”的类别(168张图中有25张如此,其他5种交通工具的这类情况为0),且20%的飞机图在交通工具维度得分仅为1或2分,而自行车的这一比例为5%,船、踏板车和滑板则为0。
证据四:即便调整难度因素,实验室也未更擅长画鹈鹕骑车
将两者结合来看,“鹈鹕骑车”在48种组合中排名第42,接近末尾:
但同样,有些组合可能本身就更难画。
为了排除难度因素的影响,我对1008张图进行了固定效应回归分析:得分 ~ 实验室 + 动物×交通工具,再加上各实验室针对鹈鹕、自行车以及“鹈鹕骑车”组合的交互项,并使用稳健标准误。其中动物×交通工具项涵盖了48种组合的固有难度,交互项则衡量各实验室相对于平均水平的基准专项提升幅度,并给出置信区间。
结果如下:
- 所有实验室的鹈鹕专项效应(即该实验室在所有6种交通工具组合中绘制鹈鹕的得分提升)介于-0.11至+0.14评审分之间,且均未达到显著性水平(最小p值为0.25)。
- 各实验室的自行车专项效应(即该实验室在所有8种动物组合中绘制自行车的得分提升)范围从Grok 4.5的-0.18(p=0.11)到Gemini 3.5 Flash的+0.27(p=0.022)。仅Gemini的结果p值小于0.05,且7款模型的效应方向正负皆有。
- 所有实验室的“鹈鹕骑车”组合专项效应(即在鹈鹕和自行车专项效应之外,该特定组合的额外得分提升)均未达到p<0.05的显著性水平。其中最大的正向效应来自GLM-5.2的+0.35(p=0.12),也就是我之前提到的那个样本。这是本次实验中最接近“存在优化”的信号,但仍属于随机误差范围。
以下是各实验室的完整估算值。若某实验室进行了“鹈鹕专项优化”,其整行的点应落在零刻度线右侧:
所有鹈鹕专项和组合专项的置信区间都包含零值,仅有一个例外:Gemini 3.5 Flash的自行车专项效应。但在21次测试中,按p<0.05的显著性水平,随机概率下本就可能出现约1次假阳性(21×0.05≈1.05),而本次实验恰好出现1次。此外,经过多重比较校正后,该结果也不再显著:21次测试的Bonferroni阈值为0.05/21≈0.002,而其p值为0.022。完整的估算值和p值表格可在代码库中查看。
不过需要说明的是,这些置信区间较宽,平均约为±0.6评审分,任何小于该幅度的得分提升都无法被本次检测捕捉到。
证据五:鹈鹕骑车的画面并非记忆复刻
有人认为鹈鹕骑车的画面像是模型记忆的固定构图,理由是存在重复模式,比如鹈鹕总是朝右,或是画面中反复出现太阳、围巾等元素。我对此做了验证。
朝向:7款模型生成的21张鹈鹕骑车图,全部是朝右的。这是所有组合中唯一一个所有样本朝向完全一致的。
不过朝右本身就是普遍现象:1008张图中有60%都是朝右的。具体比例因动物和交通工具而异,而自行车是两种最倾向于朝右的交通工具之一:
| 交通工具 | 朝左 | 朝右 | 方向模糊 |
|---|---|---|---|
| 踏板车 | 9% | 83% | 8% |
| 自行车 | 11% | 81% | 8% |
| 滑板 | 19% | 60% | 21% |
| 飞机 | 21% | 58% | 21% |
| 独轮车 | 22% | 45% | 33% |
| 船 | 33% | 35% | 32% |
鹈鹕本身也属于倾向朝右的动物:
| 动物 | 朝左 | 朝右 | 方向模糊 |
|---|---|---|---|
| 羚羊 | 21% | 78% | 1% |
| 鹈鹕 | 22% | 78% | 0% |
| 苍鹭 | 22% | 77% | 1% |
| 鲸鱼 | 34% | 65% | 1% |
| 火烈鸟 | 36% | 64% | 0% |
| 水獭 | 8% | 45% | 47% |
| 猫 | 8% | 40% | 52% |
| 浣熊 | 3% | 36% | 61% |
由于很难画出面向观者的鹈鹕或自行车,模型几乎总是采用侧面视角,朝左或朝右,因此这类图的方向模糊比例极低。其他组合也有接近全一致的情况:羚羊骑踏板车、鹈鹕骑踏板车的21张样本中各有20张朝右,苍鹭骑车的21张样本中有19张朝右。因此21张全朝右并不算是异常值。
画面元素:我让特征提取器识别图中出现的所有元素,统计结果如下:
若画面是记忆复刻,那么同一组合的每张图应该出现相同的元素。我确实发现有些组合存在这样的规律:所有火烈鸟坐船的图里都有太阳;38%的水獭坐飞机图里有水獭戴围巾;38%的猫骑自行车图里有车筐。
但鹈鹕骑车的图并没有什么特别之处,只是像其他组合一样,有一些出现频率较高的元素而已。
局限性
- 单一LLM评审打分:所有得分均来自GPT-5.6 Luna对单张图片的评估。我未做太多一致性校准,也未验证它重复打分的吻合度。如果该模型无法可靠地评判画作,那么以上所有数据都没有太大意义。此外,评审模型与参赛模型之一GPT-5.6 Terra同属一个系列。不过由于每个实验室都生成了全部48种组合,若评审偏好某一实验室的风格,会提升该实验室所有作品的得分,但这并不影响本次分析——因为我们只关注同一实验室内部的差异。
- SVG整体优化:若某实验室针对SVG生成(或“动物+交通工具”这类子集)进行了整体优化,会提升所有组合的得分,看起来就像该实验室本身实力强劲。谷歌/DeepMind等实验室就公开进行这类优化。本次实验无法检测出这种情况。
- 预算有限:整个实验的API费用约为80美元,这限制了每个组合仅能生成3份样本,只能使用单一评审模型,且仅能测试7款模型。这也导致我无法在提示词和流程上做更多迭代,比如“plane”和“airplane”的问题就未能提前规避。
结论
抱歉了,Hacker News上的质疑者们,几乎没有证据表明AI实验室在进行“鹈鹕专项优化”——至少没有以明显的方式这么做。
鹈鹕的绘制水平并不优于其他动物,自行车的绘制水平也不优于其他交通工具,且没有哪个实验室画“鹈鹕骑车”的水平超出其画鹈鹕和自行车的平均水平。GLM-5.2的表现最接近“存在优化”:它在“鹈鹕骑车”组合上的得分提升最大,且第一份样本确实让我眼前一亮。但这个效应很小,且不具备统计显著性,因此不必过度解读。
另一个值得注意的点是画面构图的朝向:21张鹈鹕骑车图全部朝右,是所有组合中唯一一个完全一致的。但这并不奇怪,因为朝右是本次实验的整体趋势。另有3种组合的朝右比例达到90%以上,在48种组合中出现一个100%朝右的情况,并不意外。
更合理的解释是类似谷歌/DeepMind所做的SVG整体优化,其他实验室可能也在悄悄进行。遗憾的是,本次实验无法判断哪些实验室这么做了。但至少你可以放心:AI实验室并没有为了骗过西蒙·威利森,就生成几万亿张鹈鹕骑车的图。
如果你想亲自查看数据,完整实验流程可在代码库中获取。
注释
- 指针对热门基准测试优化AI模型以获得高分的做法。-↩︎
引用
@online{castillo2026,
author = {Castillo, Dylan},
title = {Are {AI} Labs Pelicanmaxxing?},
date = {2026-07-18},
url = {https://dylancastillo.co/posts/pelicanmaxxing.html},
langid = {en}
}