💬 观点Simon Willison
Are AI labs pelicanmaxxing? — 系统测试证实AI实验室未刻意优化“骑自行车鹈鹕”生成能力。
系统测试证实AI实验室未刻意优化“骑自行车鹈鹕”生成能力。
2026-07-22原文
本文为要点摘要,完整细节以原文为准。
- 研究者Dylan Castillo用8种动物×6种交通工具共48个提示,对7个模型各测试3次,评估生成质量。
- 结果显示,没有模型在“骑自行车鹈鹕”上表现显著优于其他动物-交通工具组合,排除针对性优化。
- 这意味着开发者不应依赖非正式基准或传闻来评估模型能力,需采用系统化、可复现的评估方法。
原文:Are AI labs pelicanmaxxing? · 作者 Simon Willison