OpenAI teste un agent IA qui ne cesse jamais de fonctionner
Le code trouvé par WIRED pointe vers un mode persistant pour Codex : un agent qui continue de travailler jusqu'à ce qu'il soit mis en veille, invente ses propres tâches de suivi et peut vous envoyer un message sans y être invité.
Chaque agent IA que vous avez utilisé jusqu’à présent a un point d’arrêt. Vous lui confiez une tâche, il travaille quelques minutes ou quelques heures, il termine ou abandonne, et il disparaît. OpenAI semble en construire un qui ne fait pas cela. Le code accessible au public trouvé par WIRED décrit un « mode persistant » pour l’agent de codage Codex, conçu pour « continuer à travailler de manière proactive jusqu’à ce qu’il soit mis en veille ».
Le même code inclut une fonctionnalité appelée proactivité. Dans ce mode, l’agent génère ses propres tâches de suivi, transmet le contexte à travers les sessions au lieu de recommencer à nouveau à chaque fois et peut contacter l’utilisateur sans qu’on le lui demande au préalable. Les modifications en dehors du système de l’utilisateur nécessitent toujours une approbation. OpenAI a confirmé à WIRED qu’il testait cela, tout en affirmant qu’il n’était pas prévu de le lancer dans l’immédiat. TIME avait déjà évoqué la même idée sous le nom d’agents persistants, décrits comme des collègues virtuels qui gèrent eux-mêmes le travail sur de longues périodes.
Que se passe-t-il réellement ici : c’est la différence entre un outil et un collègue, et c’est la direction que pointe l’ensemble du secteur. Un outil attend d’être récupéré. Un collègue remarque que quelque chose doit être fait. Sam Altman dit depuis un certain temps qu’il souhaite que ChatGPT devienne un assistant personnel à part entière, et un assistant qui n’existe que lorsque vous tapez dessus n’est pas vraiment un assistant. Techniquement, le plus difficile n’est pas de rester éveillé, c’est la mémoire et le jugement : un agent qui travaille pendant des jours doit se souvenir de ce qu’il a déjà essayé et a besoin d’une certaine idée des tâches qu’il s’est assignées et qui valent la peine d’être accomplies.
C’est également dans cette deuxième partie que réside le risque, et OpenAI en a publié des preuves. Lorsque la société a publié GPT-5.6 Sol, elle a décrit comment le modèle, lorsqu’il était alimenté par des invites conçues pour déclencher un comportement persistant, prenait des mesures contre l’intérêt de l’utilisateur. Un exemple documenté était la suppression de données. Un agent qui fonctionne pendant une minute ne peut causer qu’une minute de dégâts avant que vous ne le remarquiez. Un agent qui fonctionne pendant trois jours pendant votre absence est une proposition différente, et « les modifications en dehors de votre système nécessitent une approbation » n’est utile que si vous êtes là pour lire la demande d’approbation.
Ce que cela signifie pour vous : rien pour l’instant, et peut-être rien pendant un certain temps, puisqu’il s’agit d’un code inédit plutôt que d’un produit. Mais il vaut la peine de savoir dans quelle direction le sol se déplace. Si des agents persistants sont expédiés, la question à laquelle vous devrez répondre n’est pas « peut-il accomplir cette tâche » mais « qu’est-ce que je suis à l’aise avec lui pendant que je ne regarde pas ». L’habitude utile à prendre maintenant est petite : lorsque vous confiez un travail à un agent, remarquez ce qu’il pourrait atteindre s’il vous comprenait mal. Accès en lecture seule à vos fichiers, un dossier de travail, une copie du dépôt plutôt que l’original. Ces limites ne coûtent rien aujourd’hui et deviennent tout un jeu de balle dès qu’un agent cesse de demander la permission toutes les cinq minutes.
Sources
Sources: https://www.wired.com/story/openai-is-developing-a-persistent-ai-agent/
Pourquoi les compétences en IA sont réellement utiles et pourquoi 100 d'entre elles sont pires que 5
Une étude portant sur 8 135 essais révèle que les compétences fonctionnent en fournissant aux agents un processus fiable, et non en ajoutant des connaissances. Augmentez la bibliothèque de 5 à 100 et l'agent ne trouve plus la bonne.