Les compétences améliorent les agents IA en leur fournissant une liste de contrôle et non des faits. Et ils arrêtent de travailler à 100 entrées
Princeton et l'UC San Diego ont effectué 8 135 tests contrôlés. La procédure expliquait 65,7 pour cent des gains, les connaissances seulement 4,5. L'augmentation de la bibliothèque de 5 à 100 compétences a fait chuter la précision de récupération de 29,6 à 3,3 pour cent.
Les compétences sont progressivement devenues le moyen standard d’améliorer un agent IA dans un domaine sans le recycler. Vous écrivez comment une tâche est effectuée, l’agent la lit lorsque la tâche se présente. Une étude de l’Université de Princeton, de l’UC San Diego et d’autres écoles, publiée le 22 août, est la première à se demander attentivement pourquoi cela fonctionne. La réponse n’est pas celle que la plupart des gens supposent.
Les chercheurs ont comparé des agents résolvant des tâches identiques avec et sans compétence, sur 8 135 tests. Dans 65,7 % des cas où la compétence a aidé, la raison était ce qu’ils appellent l’ancrage procédural : la compétence indiquait à l’agent quelles étapes exécuter, quels outils dans quel ordre et quelles vérifications effectuer en cours de route. La fourniture de faits manquants ne représentait que 4,5 pour cent.
En termes simples : une compétence fonctionne comme une liste de contrôle, pas comme une encyclopédie. Cela n’enseigne pas au modèle quelque chose qu’il ne savait pas. Cela empêche le modèle d’improviser l’ordre des opérations, là où les agents ont tendance à tomber. Les erreurs qui disparaissent sont les plus ennuyeuses, comme la mauvaise configuration d’un environnement de travail ou la production de résultats dans un mauvais format.
Les deux façons dont les compétences se retournent contre eux
Les compétences introduisent également leurs propres échecs. Dans 10 % des cas, l’agent a appliqué mécaniquement un manuel de jeu par ailleurs judicieux, dans une situation où il ne convenait pas. Il est intéressant de noter qu’une correspondance exacte n’est ni requise ni suffisante. Une compétence vaguement liée donne souvent suffisamment de direction, tandis qu’une compétence parfaitement adaptée peut encore être suivie trop littéralement.
Le plus gros problème est de trouver la bonne compétence. Lorsque la bibliothèque est passée de 5 entrées à 100, la précision de la récupération en utilisation réelle est passée de 29,6 pour cent à 3,3 pour cent. Les options qui se ressemblent rendent le choix plus difficile, pas plus facile. Ainsi, plus vous écrivez de compétences, moins votre agent choisit la bonne de manière fiable, ce qui est une conclusion inconfortable pour quiconque est occupé à construire une grande bibliothèque.
Les auteurs soutiennent que les compétences devraient être traitées comme un cycle de vie plutôt que comme une pile. De meilleurs agents d’auto-amélioration proviendront de moyens plus fiables pour créer, récupérer et appliquer des compétences, et non d’en stocker davantage. Il vaut la peine de garder les attentes fondées : il s’agit d’expériences contrôlées sur des tâches de référence, et les nombres de récupération dépendent de la méthode utilisée pour rechercher dans la bibliothèque.
Ce que cela signifie pour vous : Si vous n’avez jamais écrit de compétence, les conclusions sont encourageantes. Vous n’avez pas besoin d’être un expert en la matière pour aider un agent. Écrire les étapes que vous prendriez, dans l’ordre, constitue l’essentiel de la valeur. Si vous disposez déjà d’un ensemble de compétences, l’avertissement est concret : gardez la bibliothèque petite et les descriptions clairement distinctes les unes des autres. Dix entrées rédigées de manière précise battront soixante celles qui se chevauchent, et l’étude chiffre désormais pourquoi.
##Sources
- [Comprendre les compétences des agents : mise à la terre procédurale et limites de récupération] (https://arxiv.org/abs/2608.14036), préimpression arXiv 2608.14036
- Une étude explique pourquoi les agents IA bénéficient des “compétences” et quand ils échouent, The Decoder
Sources: https://arxiv.org/abs/2608.14036
Anthropic a mis en œuvre son modèle le plus restreint en analysant le code à la recherche de bogues. Un humain doit encore approuver chaque correctif
Claude Security fonctionne désormais sur Mythos 5, le modèle Anthropic ne sort pas en version générale car il est trop doué pour les cybertâches. Il est en version bêta publique pour les clients Enterprise, et les partenaires protégeant les hôpitaux et les banques y ont également accès.