AI实验室是否在偷偷训练模型画“骑自行车的鹈鹕”?一项严谨测试给出否定答案
针对AI社区热议的“pelicanmaxxing”现象——实验室是否刻意优化模型生成骑自行车鹈鹕的能力?Dylan Castillo设计48个提示词、7个模型、3轮测试,结论是:没有证据。本文解读测试细节,并讨论对中文用户使用AI图像生成的影响。
一句话看懂
一项系统测试表明,主流AI实验室并未刻意优化模型生成“骑自行车的鹈鹕”的能力,所谓的pelicanmaxxing现象缺乏证据。
详细发生了什么
AI社区流传一个梗:实验室是否在偷偷训练模型,让它们更擅长画“骑自行车的鹈鹕”(pelican riding a bicycle)?这个说法源于Simon Willison的“非科学基准测试”。为了验证,Dylan Castillo设计了一套严谨方法:
他选取8种动物(鹈鹕、火烈鸟、苍鹭等)× 6种交通工具(自行车、独轮车、滑板、踏板车、飞机、船)= 48个提示词,每个提示词重复3次,分别测试7个模型:GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2和DeepSeek V4 Pro。然后使用GPT-5.6 Luna和Gemini 3.1 Flash-Lite辅助评估结果。
结论明确:没有发现任何pelicanmaxxing证据。具体来说:
- 鹈鹕骑自行车的图片质量并不比其他组合更好
- 实验室模型画鹈鹕的能力并不突出
- 画自行车的能力也不突出
- 即使调整难度,鹈鹕骑自行车也没有表现出特殊优势
中文圈视角
这个测试对中文用户有几点启示:
-
国产模型表现如何? 测试包含Qwen3.7-Max(阿里通义千问)、GLM-5.2(智谱)、DeepSeek V4 Pro(深度求索)。结果显示,它们与其他国际模型在“特定动物+交通工具”任务上无明显差距,说明国产模型在图像生成的基础能力上已与国际接轨。
-
“过度拟合”担忧被缓解:中文社区常担心模型被“定向优化”导致泛化能力下降。这个测试表明,至少在这个趣味场景下,实验室没有作弊。用户不必担心模型只会画鹈鹕骑自行车。
-
实际使用建议:如果你用国产模型生成“猫开汽车”或“狗骑摩托”,效果应该与“鹈鹕骑自行车”相当,无需刻意回避特定组合。
-
测试方法可借鉴:中文用户评估AI图像模型时,可以用类似“多动物×多交通工具”的交叉测试,更全面了解模型能力,而非依赖单一提示词。
几条值得记住的细节
- 测试涉及48个提示词(8动物×6交通工具),每个提示词重复3次,共144次生成/模型
- 7个测试模型包括GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2、DeepSeek V4 Pro
- 评估使用GPT-5.6 Luna和Gemini 3.1 Flash-Lite辅助
- 结论明确:无证据表明实验室在“pelicanmaxxing”
- 测试结果可通过交互式网格视图探索
一句话总结
别担心AI模型被偷偷“特训”成画鹈鹕专家——至少目前没有证据,你可以放心尝试各种动物+交通工具组合。