AI 见闻
精选· 重要性 3/5

AI实验室是否在刻意训练模型画骑自行车的鹈鹕?一项严谨调查

Simon Willison's Weblog··约 2 分钟阅读
中文导读

Dylan Castillo针对AI实验室是否故意优化模型生成“骑自行车的鹈鹕”这一非正式基准进行了系统测试,涉及8种动物×6种交通工具的48个提示,在7个模型上各运行3次,未发现pelicanmaxxing的证据。

2026年7月22日 - 链接博客AI实验室是否在pelicanmaxxing?(via)Dylan Castillo的出色工作,他深入探讨了一个经常被思考的问题:AI实验室是否一直在故意训练模型,以回应我极不科学的基准,绘制骑自行车的鹈鹕。

过去我曾随机抽查,用其他动物骑其他交通工具来测试模型,但从未像Dylan的方法论这样严谨。

Dylan选取了8种动物×6种交通工具=48个提示,在7个不同模型(GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2和DeepSeek V4 Pro)上各运行三次。

然后他使用GPT-5.6 Luna和Gemini 3.1 Flash-Lite帮助评估结果。

有一个简洁的筛选视图用于探索结果:对于他测试的模型,他没有发现pelicanmaxxing的证据:- 骑自行车的鹈鹕看起来并没有更好- 实验室并不更擅长画鹈鹕- 实验室并不更擅长画自行车- 实验室并不更擅长画骑自行车的鹈鹕,

即使调整了难度- 鹈鹕骑自行车的场景看起来并非记忆生成[……]鹈鹕并不比其他动物画得更好。自行车并不比其他交通工具画得更好。而且,没有一个实验室画出的组合比其鹈鹕和自行车本身的表现更好。

GLM-5.2最接近:它在精确的鹈鹕-自行车单元格上有最大的提升,而且它的第一个鹈鹕骑自行车样本引起了我的注意。但效果很小且不显著,所以我不会过分看重它。

近期文章- 与Claude Code团队的Cat和Thariq炉边谈话 - 2026年7月21日- Kimi K3,以及我们仍能从鹈鹕基准中学到什么 - 2026年7月16日- 新的GPT-5.6系列:Luna、Terra、Sol - 2026年7月9日

原文出处
Are AI labs pelicanmaxxing?

本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。

相关阅读