CourionAI
FR
Newsletter
← Toutes les actus
ai-for-science 3 min de lecture

Les agents IA ont rendu les logiciels de recherche 60 fois plus rapides et se sont trompés avec confiance d'une manière que personne n'a repérée pendant des semaines

Un rapport de terrain d'OpenAI et de partenaires universitaires documente huit projets dans lesquels des agents de codage ont modernisé des logiciels scientifiques négligés. Les accélérations sont réelles. Il en va de même pour les bugs qui ne sont apparus que lors de tests statistiques appropriés.

Une bande transporteuse rapide de pièces de machine identiques et brillantes fonctionnant sous une lampe d'inspection, avec une pièce pliée passant inaperçue

Une grande partie de la science repose sur des logiciels qui ont été écrits une seule fois, pour un seul article, par des personnes n’ayant pas le temps de le maintenir. Un nouveau rapport de terrain d’OpenAI et d’un ensemble de partenaires universitaires documente huit tentatives pour confier ce problème aux agents de codage de l’IA, et les résultats vont dans les deux sens et méritent d’être lus attentivement.

Les accélérations ne sont pas minimes. RustQC, qui a fusionné quinze outils de contrôle qualité distincts en un seul programme, a réduit une exécution de 15 heures et 34 minutes à 14 minutes et 54 secondes, soit plus de soixante fois plus rapide. HelixForge, une réécriture qui a déplacé la génération de données génomiques sur des cartes graphiques, a terminé un pipeline de tests 59,6 fois plus rapidement que l’outil qu’il a remplacé. Une reconstruction de l’aligneur de génome STAR, soit plus de 20 000 lignes de C et C++ que personne ne maintient plus, a été réimplémentée dans le langage Rust et concorde avec l’original sur 99,815 % des lectures de tests.

Puis l’autre moitié. Dans une réécriture d’un package de statistiques appelé bayesm, un agent a inversé un paramètre de contrôle afin que le programme utilise silencieusement l’inverse des valeurs prévues, et un deuxième bug réside dans le calcul lui-même. Ni l’un ni l’autre n’est apparu dans la sortie ordinaire. Les chercheurs ne les ont trouvés qu’en effectuant un test d’étalonnage sur des milliers d’ensembles de données synthétiques avec des réponses connues. Philip Ewels, qui dirigeait RustQC, a décrit les agents comme « éloquents, convaincants et confiants dans leurs erreurs, d’une manière qui est facile à manquer », et ne laisse jamais un modèle juger de sa propre exactitude.

Qu’est-ce qui se cache derrière cela. La division du travail qui a fonctionné était cohérente dans les huit projets : les humains définissaient l’objectif, les critères de réussite et les tests, les agents rédigeaient le code. Cet ordre constitue toute la découverte. Un agent de codage optimise pour produire quelque chose qui s’exécute et réussit quel que soit le contrôle qui lui est donné, ce qui est un objectif différent de la production de quelque chose de correct. Lorsque le contrôle est une suite de tests conçue par les humains indépendamment, les deux cibles s’alignent. Lorsqu’on demande au modèle d’évaluer son propre travail, ils s’effondrent et l’échec est discret car le résultat semble toujours plausible. Ce n’est pas propre à la science. Une étude réalisée par METR a révélé que les responsables du projet rejetteraient environ la moitié des solutions obtenues dans un référentiel de codage largement utilisé comme étant réussies. Les auteurs du rapport prennent soin de préciser que leurs huit cas ne constituent pas une étude représentative, et ils signalent un deuxième problème : les réécritures bon marché sont faciles à produire et coûteuses à maintenir pour toujours.

Ce que cela signifie pour vous: le modèle est transféré directement à tout ce que vous déléguez à un modèle, qu’il s’agisse de code, d’une feuille de calcul ou d’un résumé de recherche. Décidez comment vous allez vérifier le résultat avant de le demander et effectuez la vérification indépendamment de l’élément vérifié. Demander à un modèle si sa propre réponse est juste est presque inutile, car le même raisonnement qui a produit l’erreur la confirmera. Pour quiconque écrit du code, la version concrète est que le temps gagné sur l’écriture a tendance à réapparaître sous forme de temps consacré à la révision, et les projets qui se sont bien déroulés sont ceux pour lesquels quelqu’un a construit le faisceau de tests en premier.

Sources

Sources: https://cdn.openai.com/pdf/scientific-computing-in-the-age-of-agentic-ai-an-exploratory-field-report.pdf

Article suivant

Une vraie faille macOS est restée non signalée, l'inbox du bug bounty d'Apple étant noyée sous les déchets générés par l'IA

Apple a limité le nombre de rapports que chaque chercheur en sécurité peut déposer, car un flot de signalements générés par l'IA et décrivant des failles imaginaires encombre la file. Une start-up italienne n'a ainsi pas pu signaler une véritable faille macOS.

Une corbeille de bureau débordante, enfouie sous une pile instable de fiches blanches identiques, avec une enveloppe scellée coincée tout au fond derrière une grille fermée