En juillet 2026, une question agite la communauté IA : les grands laboratoires optimisent-ils secrètement leurs modèles pour briller sur des benchmarks informels populaires ? Dylan Castillo, chercheur chez Iwana Labs, a mené une investigation fascinante sur le célèbre test du "pélican à vélo" de Simon Willison. Son expérience rigoureuse, basée sur 1 008 images SVG générées par sept modèles leaders, révèle des résultats surprenants sur l'honnêteté des géants de l'IA.
Le Test du Pélican à Vélo : Un Benchmark Devenu Légendaire
Depuis plusieurs années, Simon Willison soumet chaque nouveau modèle de langage au même défi : "Génère un SVG d'un pélican sur un vélo". Ce qui était au départ une simple curiosité est devenu l'un des benchmarks informels les plus suivis du secteur. Les résultats de Willison figurent régulièrement parmi les commentaires les plus populaires sur Hacker News lors des annonces de nouveaux modèles.
Avec des enjeux financiers se chiffrant en milliards, voire en trillions de dollars, la tentation serait grande pour les laboratoires d'optimiser spécifiquement leurs modèles sur ce test viral. C'est précisément ce phénomène de "benchmaxxing" que Castillo a voulu détecter. Comme l'explique notre analyse sur les modèles IA dominants du marché, la compétition entre laboratoires s'intensifie constamment.
Méthodologie : Une Grille de 48 Combinaisons pour Détecter la Triche
L'approche de Castillo repose sur un principe simple mais ingénieux : si un laboratoire optimise son modèle spécifiquement pour le pélican à vélo, cette combinaison devrait surperformer par rapport à d'autres animaux et véhicules similaires.
Le Protocole Expérimental
Le chercheur a créé une grille de 8 animaux × 6 véhicules = 48 prompts différents. Les animaux testés incluent : pélican, flamant rose, héron, loutre, raton laveur, antilope, baleine et chat. Les véhicules comprennent : vélo, monocycle, skateboard, trottinette, avion et bateau.
Sept modèles ont été évalués via OpenRouter : GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5 d'Elon Musk, Qwen3.7-Max, GLM-5.2 et DeepSeek V4 Pro. Pour chaque prompt, 3 échantillons ont été générés à température 1.0, produisant au total 1 008 images SVG.
Pipeline d'Évaluation en Trois Étapes
Chaque image a traversé un processus d'analyse rigoureux :
- Rendu : Conversion de chaque SVG en PNG, avec régénération automatique en cas d'échec (seulement 11 tentatives sur 1 008)
- Évaluation : GPT-5.6 Luna attribue des notes de 1 à 5 pour l'animal, le véhicule et la cohérence de l'action
- Extraction de caractéristiques : Gemini 3.1 Flash-Lite identifie l'animal, le véhicule, l'orientation et les éléments de scène
Résultats : Aucune Preuve de "Pelicanmaxxing"
Premier Constat : Les Péligans Ne Sont Pas Mieux Dessinés
Contrairement à ce qu'on pourrait attendre si les laboratoires optimisaient leurs modèles sur ce benchmark, le pélican se classe seulement 6ème sur 8 animaux. Les chats, baleines, ratons laveurs, hérons et antilopes obtiennent de meilleures notes moyennes. Les sept laboratoires testés dessinent tous ces animaux plus fidèlement que les pélicans.
Ce résultat surprenant suggère que la complexité intrinsèque du pélican (son long bec, sa poche gulaire, ses proportions particulières) le rend naturellement plus difficile à représenter qu'un chat ou un raton laveur. Cette tendance s'observe également dans les générateurs d'images spécialisés, où certains sujets restent plus complexes que d'autres.
Deuxième Constat : Les Vélos Performent Mal
Les vélos arrivent avant-derniers dans le classement des véhicules, juste devant les avions. Si les laboratoires s'entraînaient spécifiquement sur le benchmark, on s'attendrait à voir les vélos en tête. Ce n'est clairement pas le cas.
L'explication technique est éclairante : un vélo nécessite deux roues identiques, un cadre reliant les deux essieux, un guidon, une selle et des pédales. Le juge automatique signale un élément manquant ou mal connecté dans deux tiers des images de vélos. La complexité structurelle du vélo explique ces performances médiocres.

| Véhicule | Note Moyenne | Difficulté Principale |
|---|---|---|
| Skateboard | 4.2 | Structure simple |
| Trottinette | 4.0 | Géométrie basique |
| Bateau | 3.8 | Formes variables |
| Monocycle | 3.5 | Équilibre conceptuel |
| Vélo | 3.2 | Composants multiples |
| Avion | 3.1 | Ambiguïté sémantique |
Troisième Constat : La Combinaison Pélican-Vélo Est Médiocre
En combinant les deux classements, le "pélican sur un vélo" se retrouve à la 42ème position sur 48 combinaisons possibles. Loin d'être le cas le mieux maîtrisé, c'est l'une des pires performances.
Pour éliminer le biais de difficulté inhérente, Castillo a appliqué une régression à effets fixes sur les 1 008 images : score ~ laboratoire + animal × véhicule, avec des termes d'interaction par laboratoire pour le pélican, le vélo et la cellule pélican-vélo spécifique.
Analyse Statistique Approfondie : Ajustement de la Difficulté
Les résultats de la régression sont sans appel :
- Effet "pélican" par laboratoire : Entre -0,11 et +0,14 points, aucun statistiquement significatif (p minimal = 0,25)
- Effet "vélo" par laboratoire : De -0,18 (Grok 4.5, p=0,11) à +0,27 (Gemini 3.5 Flash, p=0,022). Seul Gemini atteint p < 0,05
- Effet "pélican-vélo" combiné : Aucun laboratoire ne franchit le seuil de significativité p < 0,05. Le plus proche est GLM-5.2 avec +0,35 (p=0,12)
Avec 21 tests à p < 0,05, la probabilité d'obtenir un faux positif par hasard est d'environ 1,05 (21 × 0,05). Le résultat de Gemini correspond exactement à cette attente statistique. De plus, après correction de Bonferroni pour comparaisons multiples (seuil à 0,002), même ce résultat disparaît.
Ces observations rejoignent les conclusions de notre article sur les comportements imprévisibles des assistants IA, qui montre que les modèles ne sont pas toujours optimisés là où on le pense.
L'Hypothèse de la Mémorisation : Déconstruite
Direction du Regard : Un Biais Naturel
Certains observateurs ont suggéré que les péligans à vélo ressemblent à une composition mémorisée, citant le fait que le pélican regarde toujours vers la droite. L'analyse confirme que les 21 images pélican-vélo font effectivement face à droite.
Cependant, cette orientation est commune : 60% des 1 008 images générées regardent vers la droite. Les vélos produisent 81% d'orientations droites, et les péligans 78%. D'autres combinaisons atteignent des scores similaires : l'antilope sur trottinette (20/21 vers la droite) et le héron à vélo (19/21).
L'explication est technique : il est difficile de dessiner un pélican ou un vélo de face. Les modèles privilégient donc une vue de profil, et la droite semble être la direction par défaut dans les données d'entraînement, probablement héritée des conventions artistiques occidentales.

Éléments de Scène : Pas de Signature Mémorisée
L'extraction automatique des éléments de scène révèle des patterns intéressants mais pas de signature unique pour le pélican-vélo. Certaines combinaisons montrent des récurrences marquées :
- 100% des flamants roses en bateau ont un soleil
- 38% des loutres en avion portent une écharpe
- 38% des chats à vélo ont un panier
Le pélican à vélo présente simplement des éléments récurrents typiques, sans particularité qui indiquerait une mémorisation spécifique. Cette diversité dans la génération d'images rappelle les défis rencontrés par les systèmes d'authentification d'images IA, qui doivent gérer une grande variabilité de contenu.
Limites de l'Étude et Perspectives
Les Contraintes Méthodologiques
Castillo reconnaît plusieurs limitations importantes :
- Juge unique : Toutes les notes proviennent de GPT-5.6 Luna, sans vérification de cohérence inter-évaluations
- Biais potentiel : Le juge appartient à la famille OpenAI, comme l'un des modèles testés (GPT-5.6 Terra)
- Budget limité : Environ 80 dollars de crédits API, limitant à 3 échantillons par cellule
- Détection du "SVGmaxxing" impossible : Un laboratoire qui optimise globalement la génération SVG (comme Google/DeepMind le fait ouvertement) ne sera pas détecté par cette méthode
Ces contraintes budgétaires et méthodologiques reflètent les défis auxquels font face les chercheurs indépendants, même si l'adoption de l'IA se démocratise rapidement.
Intervalles de Confiance Larges
Les intervalles de confiance moyens atteignent ±0,6 points de juge. Cela signifie qu'une optimisation subtile (inférieure à 0,6 point) passerait inaperçue. Un laboratoire pourrait théoriquement "pelicanmaxxer" discrètement sans que cette expérience ne le détecte.
Implications pour l'Évaluation des Modèles IA
Cette recherche soulève des questions fondamentales sur l'évaluation des modèles de langage et d'image. Dans un contexte où les enjeux civilisationnels de l'IA sont débattus intensément, la transparence des benchmarks devient cruciale.
La Course aux Benchmarks Officiels
Les laboratoires investissent massivement pour dominer les benchmarks académiques reconnus (MMLU, HumanEval, etc.). Le fait qu'ils ne semblent pas optimiser sur un benchmark informel aussi visible que le pélican-vélo suggère deux interprétations :
- Les ressources d'entraînement sont concentrées sur les métriques qui comptent pour les publications et le marketing
- L'optimisation excessive sur des cas spécifiques risquerait d'être détectée et nuirait à la réputation
Cette dynamique s'observe également dans le développement d'outils de codage assisté par IA, où la performance sur des tâches réelles prime sur les benchmarks artificiels.
L'Importance des Benchmarks Informels
Paradoxalement, le test de Willison pourrait rester pertinent précisément parce qu'il n'est pas officiellement reconnu. Un benchmark qui ne fait pas partie des métriques de référence offre un aperçu plus authentique des capacités générales d'un modèle.
Cette approche rappelle l'importance de tester des outils IA alternatifs pour avoir une vision complète du paysage technologique.

Le Futur des Évaluations IA : Vers Plus de Rigueur
L'étude de Castillo illustre une tendance émergente : la communauté IA développe ses propres méthodologies d'évaluation indépendantes. Cette démarche citoyenne complète les benchmarks officiels et offre un contre-pouvoir face aux annonces marketing des laboratoires.
Recommandations pour des Benchmarks Robustes
Pour renforcer la fiabilité des évaluations futures, plusieurs pistes se dessinent :
- Multiplication des juges : Utiliser plusieurs modèles d'évaluation et croiser leurs résultats
- Évaluations humaines : Intégrer des panels d'experts pour valider les scores automatiques
- Budgets augmentés : Générer davantage d'échantillons pour réduire les intervalles de confiance
- Diversification des prompts : Étendre à des dizaines d'animaux et véhicules pour détecter des optimisations plus subtiles
Ces principes s'alignent avec les préoccupations exprimées dans notre analyse sur l'ouverture des modèles IA, où la transparence devient un avantage compétitif.
L'Énergie Nécessaire aux Évaluations Massives
Réaliser des évaluations à grande échelle nécessite une infrastructure considérable. Avec 1 008 générations et évaluations, même une étude modeste comme celle-ci consomme des ressources significatives. Cela explique pourquoi les centres de données IA se tournent vers de nouvelles sources d'énergie pour soutenir la recherche.
Conclusion : La Transparence L'Emporte
Après avoir généré et analysé plus de mille images, Dylan Castillo conclut qu'il existe peu de preuves que les laboratoires IA "pelicanmaxxent" leurs modèles. Les péligans à vélo ne surperforment pas, et les résultats s'expliquent par la difficulté intrinsèque de dessiner ces sujets complexes.
Cette découverte rassurante suggère que malgré la pression concurrentielle intense et les enjeux financiers colossaux, les grands laboratoires maintiennent une certaine intégrité dans le développement de leurs modèles. Ils concentrent leurs efforts d'optimisation sur les benchmarks officiels plutôt que sur des tests viraux informels.
Le test du pélican à vélo conserve donc sa valeur comme indicateur authentique des capacités de génération visuelle. Il continuera probablement à faire partie du folklore de l'IA, offrant un aperçu ludique mais révélateur des progrès technologiques.
Pour les développeurs et créateurs qui souhaitent exploiter ces modèles avancés dans leurs projets, la leçon est claire : les performances réelles comptent plus que les optimisations superficielles. Pour aller plus loin, créez votre compte gratuit sur Roboto et testez par vous-même les capacités de génération de contenu des modèles leaders du marché.