AI实验室是否在刻意训练模型画骑自行车的鹈鹕?一项严谨调查
Dylan Castillo针对AI实验室是否故意优化模型生成“骑自行车的鹈鹕”这一非正式基准进行了系统测试,涉及8种动物×6种交通工具的48个提示,在7个模型上各运行3次,未发现pelicanmaxxing的证据。
2026年7月22日 - 链接博客AI实验室是否在pelicanmaxxing?(via)Dylan Castillo的出色工作,他深入探讨了一个经常被思考的问题:AI实验室是否一直在故意训练模型,以回应我极不科学的基准,绘制骑自行车的鹈鹕。
过去我曾随机抽查,用其他动物骑其他交通工具来测试模型,但从未像Dylan的方法论这样严谨。
Dylan选取了8种动物×6种交通工具=48个提示,在7个不同模型(GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2和DeepSeek V4 Pro)上各运行三次。
然后他使用GPT-5.6 Luna和Gemini 3.1 Flash-Lite帮助评估结果。
有一个简洁的筛选视图用于探索结果:对于他测试的模型,他没有发现pelicanmaxxing的证据:- 骑自行车的鹈鹕看起来并没有更好- 实验室并不更擅长画鹈鹕- 实验室并不更擅长画自行车- 实验室并不更擅长画骑自行车的鹈鹕,
即使调整了难度- 鹈鹕骑自行车的场景看起来并非记忆生成[……]鹈鹕并不比其他动物画得更好。自行车并不比其他交通工具画得更好。而且,没有一个实验室画出的组合比其鹈鹕和自行车本身的表现更好。
GLM-5.2最接近:它在精确的鹈鹕-自行车单元格上有最大的提升,而且它的第一个鹈鹕骑自行车样本引起了我的注意。但效果很小且不显著,所以我不会过分看重它。
近期文章- 与Claude Code团队的Cat和Thariq炉边谈话 - 2026年7月21日- Kimi K3,以及我们仍能从鹈鹕基准中学到什么 - 2026年7月16日- 新的GPT-5.6系列:Luna、Terra、Sol - 2026年7月9日