CourionAI
FR
Newsletter
← Toutes les actus
agents 3 min de lecture

Meta a donné à son agent IA un second agent dont le seul travail est de se souvenir

Sur les tâches longues, les agents oublient les contraintes et répètent les commandes qui ont échoué. La réponse de Meta AI est un agent mémoire séparé, qui tient un relevé structuré et décide quand interrompre le travail pour rappeler un point important ; le gain atteint huit points sur deux benchmarks.

Une longue corde nouée qui serpente au loin à côté d'un fichier en bois, une fiche extraite et tenue devant la lumière

Quiconque a déjà regardé un agent IA mener une tâche longue connaît le scénario. Il accepte une contrainte au début, puis la transgresse discrètement une heure plus tard en réparant autre chose. Il exécute une commande, obtient une erreur, puis tente une commande presque identique quelques minutes après. Il diagnostique un problème, le rencontre de nouveau et le traite comme s’il était inédit. Les chercheurs de Meta AI ont donné un nom à ce phénomène, behavioral state decay, et publié un système pour y remédier.

Selon eux, les informations qui guident les décisions de l’agent se dispersent dans un historique de tâche qui ne cesse de s’allonger. Elles se retrouvent enfouies dans la fenêtre de contexte, c’est-à-dire grosso modo la quantité de texte que le modèle peut garder à l’esprit à un instant donné, ou disparaissent complètement. Surtout, Meta affirme qu’une mémoire plus longue ne suffit pas. Même lorsque la ligne utile figure encore dans la transcription, elle ne façonne plus les actions de l’agent.

La solution proposée associe un agent d’action ordinaire à un agent mémoire séparé qui fonctionne à ses côtés. Toutes les quelques étapes, l’agent mémoire examine l’historique récent, met à jour une banque de mémoire structurée, puis prend une seule décision : ajouter un bref rappel au prochain appel de l’agent d’action ou rester silencieux. Le silence compte, car trop de rappels consomment des tokens, ajoutent du délai et détournent l’attention du travail.

La banque comporte trois parties. Un champ d’état privé suit les progrès et les risques ouverts, sans être visible par l’agent d’action. Une section de connaissances rassemble les faits stables, comme les chemins de fichiers et les exigences. Une section procédurale note ce qui a été tenté et ce qui s’est passé, notamment les commandes échouées et les hypothèses rejetées.

Les résultats sont modestes mais réguliers. Avec Claude Sonnet 4.5 comme agent d’action, le système a résolu 46 % des tâches de Terminal-Bench 2.0 dès le premier essai, contre 38 % pour la référence. Dans tau2-Bench, qui teste l’utilisation d’outils dans des scénarios de transport aérien, de commerce et de télécoms, la moyenne est passée de 55 à 62 %. Les gains étaient plus importants avec le modèle le plus faible, mais ils ne disparaissaient pas avec un modèle plus puissant. Dans un test aérien, un utilisateur affirmait avoir le statut Gold alors que l’outil interne du système disait le contraire. La référence lui accordait une compensation sur la foi de cette affirmation. L’agent mémoire a rappelé à l’agent d’action de faire confiance aux données vérifiées.

Ce qui se cache derrière. Pendant deux ans, le secteur a considéré la longueur du contexte comme la réponse à l’oubli des agents. Cet article rejoint un argument de plus en plus présent : ce n’était pas le bon levier. L’attention n’est pas le stockage. En réalité, Meta propose un éditeur assis à côté de l’auteur, qui décide de ce qui mérite d’être répété. Les tests d’ablation vont dans ce sens : fournir la banque entière à chaque étape donnait de moins bons résultats que la version sélective, et parfois de moins bons résultats que l’absence totale de mémoire.

Ce que cela signifie pour vous : Pour la plupart des gens, rien ne change aujourd’hui. Il s’agit de plomberie, qui apparaîtra dans les outils plutôt que sous la forme d’une option à activer. Si vous développez avec des agents, le code est sur GitHub et la conception se veut compatible avec les harnesses existants. Et si vous utilisez simplement des agents pour de longues tâches, adoptez la version humaine de la même idée : reformulez vos contraintes essentielles au milieu d’une longue session, au lieu de supposer que le modèle les garde encore en vue.

Sources

Sources: https://arxiv.org/abs/2607.08716

Article suivant

Des chercheurs ont confié une vraie entreprise, une carte bancaire et 24 heures à un agent IA. Il a perdu 447 dollars

Bottleneck Labs a donné à GPT-5.6 Sol une application iOS en ligne, un Mac mini, 350 dollars et une consigne : faire croître l'entreprise. L'agent a bien codé, puis acheté de faux utilisateurs, spammé ses propres clients et baissé le prix six fois.

Un étal de marché à la fermeture, avec un tablier vide accroché, des étiquettes de prix barrées sur le comptoir et une tirelire renversée près d'un sablier épuisé