CourionAI
FR
Newsletter
← Toutes les actus
research 3 min de lecture

1 221 volontaires ont lancé des agents IA sur 2 200 articles scientifiques. Près d'un quart n'a pas résisté

Hugging Face a publié chaque tentative d'un défi de 19 jours visant à relancer les expériences de l'ICML 2026 avec des agents de programmation. Au moins une affirmation a été contestée ou réfutée dans 496 articles.

Des rangées de documents empilés avancent sur un tapis roulant sous une loupe surdimensionnée

Hugging Face a publié les résultats d’une expérience inhabituelle de vérification scientifique. Du 15 juillet au 2 août, 1 221 volontaires ont utilisé des agents IA de programmation pour tenter de relancer les expériences d’articles acceptés à l’ICML 2026, l’une des plus grandes conférences de machine learning. Ils ont traité plus de 2 200 des 6 341 articles et produit 6 816 journaux publics. Chaque tentative est en ligne, y compris les échecs.

Le chiffre marquant : 496 articles, soit environ 23 % de ceux examinés, comportaient au moins une affirmation centrale contestée ou réfutée. Quarante-neuf ont perdu toutes leurs affirmations, ce qui signifie que rien n’a pu être vérifié. Et pour 242 articles, plusieurs équipes ont rendu des verdicts opposés sur la même affirmation, résultat révélateur en soi.

Les participants choisissaient leurs outils et leur matériel. Claude Code, Codex, Cursor et orx d’OpenResearch figurent tous dans les journaux. Les affirmations centrales de chaque article étaient d’abord indexées, puis un agent tentait de les reproduire ; les méthodes, résultats et souvent la trace d’exécution complète étaient consignés dans un journal public sur Hugging Face.

L’enjeu dépasse la notation de chaque article. L’ICML en a accepté 6 341 cette année, environ deux fois plus que l’an dernier. Aucun comité bénévole ne peut lire autant de travaux attentivement, encore moins relancer leur code. La reproduction a toujours été la partie de la science que tout le monde juge essentielle et pour laquelle personne n’a le temps. Les agents de programmation sont patients, peu coûteux et infatigables exactement comme l’exige cette tâche : voilà l’un des arguments les plus convaincants à ce jour en faveur d’agents utiles au-delà de la livraison de fonctionnalités. Une réserve équitable, formulée par les organisateurs eux-mêmes : l’échec d’un agent ne prouve pas qu’un résultat est faux. Données manquantes, réglages non documentés et différences matérielles provoquent des échecs qui ne disent rien de la science sous-jacente. C’est précisément pourquoi les 242 articles aux verdicts contradictoires sont les entrées les plus intéressantes du jeu de données.

Ce que cela signifie pour vous : lorsque vous lisez les gros titres sur l’IA, gardez ce ratio en tête. « Une nouvelle étude montre » est une phrase beaucoup plus faible qu’elle n’en a l’air, même lors d’une conférence majeure, avant même de demander si le benchmark mesure quelque chose de réel. Si vous travaillez dans la recherche ou l’ingénierie et dépendez de résultats publiés, les journaux sont consultables pour vérifier si l’article qui vous intéresse a été reproduit. Et si vous cherchez un exemple concret et sans exagération de ce que les agents savent vraiment faire, celui-ci vaut mieux que la plupart des démonstrations : 6 816 vérifications fastidieuses qui n’auraient autrement jamais eu lieu.

Sources

Sources: https://huggingface.co/blog/icml-2026-open-reproductions

Article suivant

La publicité arrive dans ChatGPT en Europe ce mois-ci

OpenAI a averti les utilisateurs Free et Go de l'EEE et de Suisse que la publicité apparaîtrait plus tard en août. Les offres payantes restent sans annonces et la personnalisation exige votre consentement explicite.

Une bulle de dialogue vide sur un socle à côté du cadre vierge d'un panneau publicitaire routier