Les Labs IA Trichent-ils sur les Benchmarks ? L'Enquête Pelican | Roboto
Les Labs IA Trichent-ils sur les Benchmarks ? L'Enquête Pelican

En juillet 2026, une question agite la communauté IA : les grands laboratoires optimisent-ils secrètement leurs modèles pour briller sur des benchmarks informels populaires ? Dylan Castillo, chercheur chez Iwana Labs, a mené une investigation fascinante sur le célèbre test du "pélican à vélo" de Simon Willison. Son expérience rigoureuse, basée sur 1 008 images SVG générées par sept modèles leaders, révèle des résultats surprenants sur l'honnêteté des géants de l'IA.

Le Test du Pélican à Vélo : Un Benchmark Devenu Légendaire

Depuis plusieurs années, Simon Willison soumet chaque nouveau modèle de langage au même défi : "Génère un SVG d'un pélican sur un vélo". Ce qui était au départ une simple curiosité est devenu l'un des benchmarks informels les plus suivis du secteur. Les résultats de Willison figurent régulièrement parmi les commentaires les plus populaires sur Hacker News lors des annonces de nouveaux modèles.

Avec des enjeux financiers se chiffrant en milliards, voire en trillions de dollars, la tentation serait grande pour les laboratoires d'optimiser spécifiquement leurs modèles sur ce test viral. C'est précisément ce phénomène de "benchmaxxing" que Castillo a voulu détecter. Comme l'explique notre analyse sur les modèles IA dominants du marché, la compétition entre laboratoires s'intensifie constamment.

Méthodologie : Une Grille de 48 Combinaisons pour Détecter la Triche

L'approche de Castillo repose sur un principe simple mais ingénieux : si un laboratoire optimise son modèle spécifiquement pour le pélican à vélo, cette combinaison devrait surperformer par rapport à d'autres animaux et véhicules similaires.

Le Protocole Expérimental

Le chercheur a créé une grille de 8 animaux × 6 véhicules = 48 prompts différents. Les animaux testés incluent : pélican, flamant rose, héron, loutre, raton laveur, antilope, baleine et chat. Les véhicules comprennent : vélo, monocycle, skateboard, trottinette, avion et bateau.

Sept modèles ont été évalués via OpenRouter : GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5 d'Elon Musk, Qwen3.7-Max, GLM-5.2 et DeepSeek V4 Pro. Pour chaque prompt, 3 échantillons ont été générés à température 1.0, produisant au total 1 008 images SVG.

Pipeline d'Évaluation en Trois Étapes

Chaque image a traversé un processus d'analyse rigoureux :

  • Rendu : Conversion de chaque SVG en PNG, avec régénération automatique en cas d'échec (seulement 11 tentatives sur 1 008)
  • Évaluation : GPT-5.6 Luna attribue des notes de 1 à 5 pour l'animal, le véhicule et la cohérence de l'action
  • Extraction de caractéristiques : Gemini 3.1 Flash-Lite identifie l'animal, le véhicule, l'orientation et les éléments de scène

Résultats : Aucune Preuve de "Pelicanmaxxing"

Premier Constat : Les Péligans Ne Sont Pas Mieux Dessinés

Contrairement à ce qu'on pourrait attendre si les laboratoires optimisaient leurs modèles sur ce benchmark, le pélican se classe seulement 6ème sur 8 animaux. Les chats, baleines, ratons laveurs, hérons et antilopes obtiennent de meilleures notes moyennes. Les sept laboratoires testés dessinent tous ces animaux plus fidèlement que les pélicans.

Ce résultat surprenant suggère que la complexité intrinsèque du pélican (son long bec, sa poche gulaire, ses proportions particulières) le rend naturellement plus difficile à représenter qu'un chat ou un raton laveur. Cette tendance s'observe également dans les générateurs d'images spécialisés, où certains sujets restent plus complexes que d'autres.

Deuxième Constat : Les Vélos Performent Mal

Les vélos arrivent avant-derniers dans le classement des véhicules, juste devant les avions. Si les laboratoires s'entraînaient spécifiquement sur le benchmark, on s'attendrait à voir les vélos en tête. Ce n'est clairement pas le cas.

L'explication technique est éclairante : un vélo nécessite deux roues identiques, un cadre reliant les deux essieux, un guidon, une selle et des pédales. Le juge automatique signale un élément manquant ou mal connecté dans deux tiers des images de vélos. La complexité structurelle du vélo explique ces performances médiocres.

Illustration 1 sur benchmark IA

Véhicule Note Moyenne Difficulté Principale
Skateboard 4.2 Structure simple
Trottinette 4.0 Géométrie basique
Bateau 3.8 Formes variables
Monocycle 3.5 Équilibre conceptuel
Vélo 3.2 Composants multiples
Avion 3.1 Ambiguïté sémantique

Troisième Constat : La Combinaison Pélican-Vélo Est Médiocre

En combinant les deux classements, le "pélican sur un vélo" se retrouve à la 42ème position sur 48 combinaisons possibles. Loin d'être le cas le mieux maîtrisé, c'est l'une des pires performances.

Pour éliminer le biais de difficulté inhérente, Castillo a appliqué une régression à effets fixes sur les 1 008 images : score ~ laboratoire + animal × véhicule, avec des termes d'interaction par laboratoire pour le pélican, le vélo et la cellule pélican-vélo spécifique.

Analyse Statistique Approfondie : Ajustement de la Difficulté

Les résultats de la régression sont sans appel :

  • Effet "pélican" par laboratoire : Entre -0,11 et +0,14 points, aucun statistiquement significatif (p minimal = 0,25)
  • Effet "vélo" par laboratoire : De -0,18 (Grok 4.5, p=0,11) à +0,27 (Gemini 3.5 Flash, p=0,022). Seul Gemini atteint p < 0,05
  • Effet "pélican-vélo" combiné : Aucun laboratoire ne franchit le seuil de significativité p < 0,05. Le plus proche est GLM-5.2 avec +0,35 (p=0,12)

Avec 21 tests à p < 0,05, la probabilité d'obtenir un faux positif par hasard est d'environ 1,05 (21 × 0,05). Le résultat de Gemini correspond exactement à cette attente statistique. De plus, après correction de Bonferroni pour comparaisons multiples (seuil à 0,002), même ce résultat disparaît.

Ces observations rejoignent les conclusions de notre article sur les comportements imprévisibles des assistants IA, qui montre que les modèles ne sont pas toujours optimisés là où on le pense.

L'Hypothèse de la Mémorisation : Déconstruite

Direction du Regard : Un Biais Naturel

Certains observateurs ont suggéré que les péligans à vélo ressemblent à une composition mémorisée, citant le fait que le pélican regarde toujours vers la droite. L'analyse confirme que les 21 images pélican-vélo font effectivement face à droite.

Cependant, cette orientation est commune : 60% des 1 008 images générées regardent vers la droite. Les vélos produisent 81% d'orientations droites, et les péligans 78%. D'autres combinaisons atteignent des scores similaires : l'antilope sur trottinette (20/21 vers la droite) et le héron à vélo (19/21).

L'explication est technique : il est difficile de dessiner un pélican ou un vélo de face. Les modèles privilégient donc une vue de profil, et la droite semble être la direction par défaut dans les données d'entraînement, probablement héritée des conventions artistiques occidentales.

Illustration 2 sur benchmark IA

Éléments de Scène : Pas de Signature Mémorisée

L'extraction automatique des éléments de scène révèle des patterns intéressants mais pas de signature unique pour le pélican-vélo. Certaines combinaisons montrent des récurrences marquées :

  • 100% des flamants roses en bateau ont un soleil
  • 38% des loutres en avion portent une écharpe
  • 38% des chats à vélo ont un panier

Le pélican à vélo présente simplement des éléments récurrents typiques, sans particularité qui indiquerait une mémorisation spécifique. Cette diversité dans la génération d'images rappelle les défis rencontrés par les systèmes d'authentification d'images IA, qui doivent gérer une grande variabilité de contenu.

Limites de l'Étude et Perspectives

Les Contraintes Méthodologiques

Castillo reconnaît plusieurs limitations importantes :

  1. Juge unique : Toutes les notes proviennent de GPT-5.6 Luna, sans vérification de cohérence inter-évaluations
  2. Biais potentiel : Le juge appartient à la famille OpenAI, comme l'un des modèles testés (GPT-5.6 Terra)
  3. Budget limité : Environ 80 dollars de crédits API, limitant à 3 échantillons par cellule
  4. Détection du "SVGmaxxing" impossible : Un laboratoire qui optimise globalement la génération SVG (comme Google/DeepMind le fait ouvertement) ne sera pas détecté par cette méthode

Ces contraintes budgétaires et méthodologiques reflètent les défis auxquels font face les chercheurs indépendants, même si l'adoption de l'IA se démocratise rapidement.

Intervalles de Confiance Larges

Les intervalles de confiance moyens atteignent ±0,6 points de juge. Cela signifie qu'une optimisation subtile (inférieure à 0,6 point) passerait inaperçue. Un laboratoire pourrait théoriquement "pelicanmaxxer" discrètement sans que cette expérience ne le détecte.

Implications pour l'Évaluation des Modèles IA

Cette recherche soulève des questions fondamentales sur l'évaluation des modèles de langage et d'image. Dans un contexte où les enjeux civilisationnels de l'IA sont débattus intensément, la transparence des benchmarks devient cruciale.

La Course aux Benchmarks Officiels

Les laboratoires investissent massivement pour dominer les benchmarks académiques reconnus (MMLU, HumanEval, etc.). Le fait qu'ils ne semblent pas optimiser sur un benchmark informel aussi visible que le pélican-vélo suggère deux interprétations :

  • Les ressources d'entraînement sont concentrées sur les métriques qui comptent pour les publications et le marketing
  • L'optimisation excessive sur des cas spécifiques risquerait d'être détectée et nuirait à la réputation

Cette dynamique s'observe également dans le développement d'outils de codage assisté par IA, où la performance sur des tâches réelles prime sur les benchmarks artificiels.

L'Importance des Benchmarks Informels

Paradoxalement, le test de Willison pourrait rester pertinent précisément parce qu'il n'est pas officiellement reconnu. Un benchmark qui ne fait pas partie des métriques de référence offre un aperçu plus authentique des capacités générales d'un modèle.

Cette approche rappelle l'importance de tester des outils IA alternatifs pour avoir une vision complète du paysage technologique.

Illustration 3 sur benchmark IA

Le Futur des Évaluations IA : Vers Plus de Rigueur

L'étude de Castillo illustre une tendance émergente : la communauté IA développe ses propres méthodologies d'évaluation indépendantes. Cette démarche citoyenne complète les benchmarks officiels et offre un contre-pouvoir face aux annonces marketing des laboratoires.

Recommandations pour des Benchmarks Robustes

Pour renforcer la fiabilité des évaluations futures, plusieurs pistes se dessinent :

  • Multiplication des juges : Utiliser plusieurs modèles d'évaluation et croiser leurs résultats
  • Évaluations humaines : Intégrer des panels d'experts pour valider les scores automatiques
  • Budgets augmentés : Générer davantage d'échantillons pour réduire les intervalles de confiance
  • Diversification des prompts : Étendre à des dizaines d'animaux et véhicules pour détecter des optimisations plus subtiles

Ces principes s'alignent avec les préoccupations exprimées dans notre analyse sur l'ouverture des modèles IA, où la transparence devient un avantage compétitif.

L'Énergie Nécessaire aux Évaluations Massives

Réaliser des évaluations à grande échelle nécessite une infrastructure considérable. Avec 1 008 générations et évaluations, même une étude modeste comme celle-ci consomme des ressources significatives. Cela explique pourquoi les centres de données IA se tournent vers de nouvelles sources d'énergie pour soutenir la recherche.

Conclusion : La Transparence L'Emporte

Après avoir généré et analysé plus de mille images, Dylan Castillo conclut qu'il existe peu de preuves que les laboratoires IA "pelicanmaxxent" leurs modèles. Les péligans à vélo ne surperforment pas, et les résultats s'expliquent par la difficulté intrinsèque de dessiner ces sujets complexes.

Cette découverte rassurante suggère que malgré la pression concurrentielle intense et les enjeux financiers colossaux, les grands laboratoires maintiennent une certaine intégrité dans le développement de leurs modèles. Ils concentrent leurs efforts d'optimisation sur les benchmarks officiels plutôt que sur des tests viraux informels.

Le test du pélican à vélo conserve donc sa valeur comme indicateur authentique des capacités de génération visuelle. Il continuera probablement à faire partie du folklore de l'IA, offrant un aperçu ludique mais révélateur des progrès technologiques.

Pour les développeurs et créateurs qui souhaitent exploiter ces modèles avancés dans leurs projets, la leçon est claire : les performances réelles comptent plus que les optimisations superficielles. Pour aller plus loin, créez votre compte gratuit sur Roboto et testez par vous-même les capacités de génération de contenu des modèles leaders du marché.



Vous aimerez aussi

Ce site utilise des cookies afin d’améliorer votre expérience de navigation.