CourionAI
FR
Newsletter
← Toutes les actus
research 3 min de lecture

Cet outil d’IA qui avait « échoué » il y a six mois ? Il lui fallait peut-être simplement plus de temps

L’AI Security Institute britannique a découvert que la méthode habituelle d’évaluation des agents d’IA sous-estimait discrètement leurs capacités, parce qu’on les arrête trop tôt. Avec davantage de temps de calcul, ils résolvent bien plus de problèmes. Une explication accessible de l’enjeu pour quiconque évalue des outils d’IA.

Illustration en risographie : une courbe de performance ascendante dépasse un sablier et une jauge de carburant pour atteindre un sommet corail, des agents d’IA accomplissent davantage lorsqu’on leur accorde plus de temps

Voici un constat qui rebat discrètement les cartes de nombreux titres sur l’IA. L’AI Security Institute britannique, un organisme public qui étudie la sécurité de l’IA, affirme que notre façon de mesurer les « agents » d’IA, ces systèmes capables d’exécuter seuls des tâches en plusieurs étapes, les défavorise systématiquement. Non pas parce que les tests sont truqués, mais parce que nous interrompons l’IA avant qu’elle ait fini de réfléchir.

Le principe paraît évident une fois qu’on l’a compris. Un agent progresse quand on le laisse travailler plus longtemps : davantage de tentatives, de vérifications et de raisonnement. Or, la plupart des tests imposent un budget, c’est-à-dire une limite à la quantité de calcul que l’agent peut utiliser, mesurée en tokens, les fragments de texte traités par une IA. Si vous l’arrêtez alors qu’il est encore en train de s’améliorer, votre note reflète le plancher de ses capacités, pas leur plafond. Sur des tâches de correction de logiciels, les chercheurs ont constaté que le taux de réussite augmentait d’environ 25 % lorsqu’ils faisaient passer le budget d’un million à dix millions de tokens. Certaines tâches de sécurité n’ont été résolues qu’avec 50 millions. Même modèle, même problème, simplement assez de marge pour poursuivre le travail.

La deuxième partie est encore plus frappante. À mesure que les budgets en tokens augmentaient, l’estimation faite par l’Institut du rythme de progression des compétences de piratage de l’IA s’est révélée trop lente. Mesurée avec des budgets généreux, cette capacité double environ tous les 40 à 50 jours plutôt que tous les quelques mois, un rythme sensiblement plus rapide. C’est un constat important pour la sécurité, mais aussi un rappel : la manière de mesurer un phénomène façonne les conclusions. Pour être juste, le temps de calcul supplémentaire n’est pas une baguette magique. Lors de tests sur des questions médicales, les modèles ont atteint une limite qu’aucun budget ne permettait de franchir, et sur certaines tâches, des modèles récents ont même fait moins bien. Le temps supplémentaire aide surtout lorsque l’IA peut vérifier son propre travail, par exemple en exécutant du code pour voir s’il passe les tests.

Ce que cela signifie pour vous : Si vous avez essayé il y a quelque temps un modèle d’IA local ou un outil agentique et qu’il s’est montré décevant, ne l’écartez pas uniquement sur ce souvenir, l’outil était peut-être adapté, mais sa laisse trop courte. Et comme le prix du calcul nécessaire à l’IA continue de baisser, une capacité qui semblait trop lente ou trop coûteuse l’an dernier devient discrètement exploitable cette année. L’habitude concrète à adopter : lorsque vous confiez à une IA une tâche vraiment difficile, en particulier si elle dispose d’une vérification intégrée, comme des tests ou un compilateur, laissez-la travailler plus longtemps avant de la juger. La patience fait désormais partie d’un bon usage de ces outils.

Sources

Sources: https://www.aisi.gov.uk/blog/more-compute-more-capability-why-ai-agent-evals-need-to-account-for-test-time-compute

Article suivant

Une petite IA sur mesure a battu GPT et Claude dans un vrai métier, pour une fraction du coût

Un fonds spéculatif géant et une jeune pousse de premier plan ont montré qu’un modèle gratuit et téléchargeable, entraîné à reproduire le jugement de leurs propres experts, surpassait toutes les grandes IA sur des tâches financières, pour un coût environ quatorze fois inférieur. La leçon dépasse largement Wall Street.

Illustration en risographie : un petit engrenage corail surpasse d’immenses engrenages gris sur un graphique, un petit modèle sur mesure bat les géants