AIモデルの実力を試す!ペリカン自転車ベンチマークの真実

要約

シモン・ウィリソンは、過去数年間にわたり、主要な大規模言語モデル(LLM)を使って「自転車に乗るペリカンのSVGを生成せよ」という同じプロンプトでテストを行ってきました。このユーモラスなベンチマークは、現在ではAIにおいて非常に有名な非公式の指標となり、新しいAIモデルのリリースに関するスレッドで注目を集めています。特に、AIラボがこのベンチマークを意識してモデルを調整しているのではないかという議論も盛んです。

今回、筆者は実験を行い、7つのフロンティアモデルを使って1,008のSVGを生成し、それらをLLMで評価しました。評価基準として、ペリカンや自転車の他に、さまざまな動物と乗り物の組み合わせを含む48のプロンプトを使用しました。それぞれのモデルによる出力をPNG形式にレンダリングし、評価を受けた画像を分析しました。

結果として、ペリカンが自転車に乗っている画像が他の動物や乗り物の画像と比べて特に優れているわけではないことが明らかになりました。また、ペリカンや自転車の描写が他のモデルより優れている兆候も見られませんでした。この実験は、AIラボが特定のベンチマークに基づいてモデルを調整することの影響を探る貴重なデータとなりました。


元記事: https://dylancastillo.co/posts/pelicanmaxxing.html

公開日: Wed, 22 Jul 2026 17:17:54 +0000


この記事はAIアシスト編集により作成されています。

📰 元記事: 元記事を読む

コメントする