CourionAI
FR
Newsletter
← Toutes les actus
openai 3 min de lecture

Une IA résout en 90 minutes une énigme statistique vieille de 30 ans

Un professeur de l’université de Pennsylvanie a utilisé GPT-5.6 Sol Pro d’OpenAI pour réfuter une hypothèse ancienne sur une méthode employée chaque jour par les scientifiques. Le modèle précédent avait échoué après 20 heures. Ce que cela nous apprend vraiment sur l’IA et les idées nouvelles.

Illustration en risographie d’une grande grille de points où quelques points corail brillent comme de faux signaux, avec une loupe et une petite horloge suspendues au-dessus, évoquant une machine lancée à toute vitesse sur une énigme statistique

Voici une petite histoire qui en dit long sur l’état actuel de l’IA. Edgar Dobriban, professeur de statistiques à l’université de Pennsylvanie, a soumis un problème difficile et non résolu au tout nouveau modèle d’OpenAI, GPT-5.6 Sol Pro. Environ 90 minutes plus tard, il disposait d’une réponse qui avait échappé pendant des années aux spécialistes humains. Son prédécesseur, GPT-5.5, avait travaillé sur le même problème pendant plus de 20 heures sans rien trouver.

L’énigme paraît technique, mais son principe est simple. Lorsque des scientifiques effectuent des milliers de tests simultanément, par exemple en analysant l’ensemble du génome humain pour repérer des gènes associés à une maladie, beaucoup de « résultats » ne sont que de fausses alertes dues au hasard. En 1995, deux statisticiens ont mis au point une méthode pour maîtriser ces fausses alertes. Baptisée procédure de Benjamini-Hochberg, elle est utilisée partout : l’article original a été cité plus de 130 000 fois. Pendant des années, on a supposé que la méthode restait valable lorsque les points de données sont liés entre eux, ce qui est généralement le cas pour les données du monde réel, sans que personne ait jamais pu le démontrer. Avec l’aide de l’IA, Dobriban a construit un contre-exemple clair montrant que la méthode peut discrètement manquer son propre objectif. Des simulations ont confirmé le résultat, et il a publié le code.

Ce qui se joue : il faut garder des attentes raisonnables. L’écart découvert par l’IA est faible, un taux de fausses alertes de 0,104 alors que 0,1 était promis, ce résultat compte donc davantage pour la théorie que pour votre travail quotidien en laboratoire, et il ne signifie pas que la méthode est défaillante. Le modèle n’a pas non plus inventé de toutes pièces une idée totalement nouvelle. Il a combiné de façon inhabituelle des techniques connues que les humains n’avaient pas encore assemblées. Une grande question reste donc ouverte : les modèles entraînés sur les connaissances humaines peuvent-ils raisonner jusqu’à produire des découvertes réellement nouvelles, ou sont-ils simplement très rapides pour recombiner ce qui existe déjà ? Pour l’heure, cette « recombinaison très rapide » se révèle déjà utile.

Ce que cela signifie pour vous : si l’IA vous intéresse simplement, voici un bon exemple de ce que les outils actuels savent vraiment bien faire : partir d’un problème ardu et clairement défini, puis parcourir à toute vitesse des combinaisons qu’aucune personne ne prendrait le temps d’essayer seule. Si vous travaillez dans la recherche ou les données, la conclusion pratique est que ces modèles deviennent de véritables partenaires de réflexion face à des problèmes difficiles, et plus seulement des assistants de rédaction. La réserve honnête, formulée par un statisticien de Berkeley, a quelque chose d’aigre-doux : autrefois, un résultat marquant signifiait qu’un collègue humain était là pour le célébrer. Désormais, il peut s’agir d’un historique de discussion. Ce changement mérite qu’on s’y attarde.

Sources

Sources: https://x.com/EdgarDobriban/status/2077082912021786660

Article suivant

L’outil de programmation d’OpenAI masque désormais les échanges entre ses agents d’IA

Depuis début juin, Codex d’OpenAI chiffre les instructions qu’un agent d’IA principal transmet à ses agents auxiliaires : les développeurs ne peuvent donc plus voir comment le travail est réparti. Cette mesure est obligatoire pour les grands modèles GPT-5.6. Pourquoi les défenseurs de la transparence s’en inquiètent.

Illustration en risographie de deux mains mécaniques qui se passent une enveloppe scellée par un cadenas tandis qu’une loupe ne révèle qu’une serrure fermée, évoquant des instructions chiffrées et cachées entre des agents d’IA