AI 快讯 编译自 simon_willison #AI图像生成#模型测试#行业分析

AI实验室是否在偷偷训练模型画“骑自行车的鹈鹕”?一项严谨测试给出否定答案

针对AI社区热议的“pelicanmaxxing”现象——实验室是否刻意优化模型生成骑自行车鹈鹕的能力?Dylan Castillo设计48个提示词、7个模型、3轮测试,结论是:没有证据。本文解读测试细节,并讨论对中文用户使用AI图像生成的影响。

编译发布 2026/07/22 原文发布 2026/07/22

一句话看懂

一项系统测试表明,主流AI实验室并未刻意优化模型生成“骑自行车的鹈鹕”的能力,所谓的pelicanmaxxing现象缺乏证据。

详细发生了什么

AI社区流传一个梗:实验室是否在偷偷训练模型,让它们更擅长画“骑自行车的鹈鹕”(pelican riding a bicycle)?这个说法源于Simon Willison的“非科学基准测试”。为了验证,Dylan Castillo设计了一套严谨方法:

他选取8种动物(鹈鹕、火烈鸟、苍鹭等)× 6种交通工具(自行车、独轮车、滑板、踏板车、飞机、船)= 48个提示词,每个提示词重复3次,分别测试7个模型:GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2和DeepSeek V4 Pro。然后使用GPT-5.6 Luna和Gemini 3.1 Flash-Lite辅助评估结果。

结论明确:没有发现任何pelicanmaxxing证据。具体来说:

  • 鹈鹕骑自行车的图片质量并不比其他组合更好
  • 实验室模型画鹈鹕的能力并不突出
  • 画自行车的能力也不突出
  • 即使调整难度,鹈鹕骑自行车也没有表现出特殊优势

中文圈视角

这个测试对中文用户有几点启示:

  1. 国产模型表现如何? 测试包含Qwen3.7-Max(阿里通义千问)、GLM-5.2(智谱)、DeepSeek V4 Pro(深度求索)。结果显示,它们与其他国际模型在“特定动物+交通工具”任务上无明显差距,说明国产模型在图像生成的基础能力上已与国际接轨。

  2. “过度拟合”担忧被缓解:中文社区常担心模型被“定向优化”导致泛化能力下降。这个测试表明,至少在这个趣味场景下,实验室没有作弊。用户不必担心模型只会画鹈鹕骑自行车。

  3. 实际使用建议:如果你用国产模型生成“猫开汽车”或“狗骑摩托”,效果应该与“鹈鹕骑自行车”相当,无需刻意回避特定组合。

  4. 测试方法可借鉴:中文用户评估AI图像模型时,可以用类似“多动物×多交通工具”的交叉测试,更全面了解模型能力,而非依赖单一提示词。

几条值得记住的细节

  • 测试涉及48个提示词(8动物×6交通工具),每个提示词重复3次,共144次生成/模型
  • 7个测试模型包括GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2、DeepSeek V4 Pro
  • 评估使用GPT-5.6 Luna和Gemini 3.1 Flash-Lite辅助
  • 结论明确:无证据表明实验室在“pelicanmaxxing”
  • 测试结果可通过交互式网格视图探索

一句话总结

别担心AI模型被偷偷“特训”成画鹈鹕专家——至少目前没有证据,你可以放心尝试各种动物+交通工具组合。