CourionAI
ES
Boletín
← Todas las noticias
agents 3 min de lectura

Meta dio a su agente de IA un segundo agente cuya única tarea es recordar

En las tareas largas, los agentes olvidan las restricciones y repiten comandos fallidos. La respuesta de Meta AI es un agente de memoria separado que mantiene un registro estructurado y decide cuándo interrumpir con un recordatorio; aporta hasta ocho puntos en dos benchmarks.

Una larga cuerda llena de nudos que se pierde en la distancia junto a un archivador de fichas de madera, con una tarjeta levantada a contraluz

Quien haya visto a un agente de IA trabajar en una tarea larga conoce el patrón. Acepta una restricción al principio y, una hora después, la incumple en silencio mientras arregla otra cosa. Ejecuta un comando, recibe un error y unos minutos más tarde prueba otro casi idéntico. Diagnostica un problema, vuelve a encontrárselo y lo trata como si fuera nuevo. Los investigadores de Meta AI han bautizado este fenómeno como behavioral state decay y han publicado un sistema para combatirlo.

Su diagnóstico es que la información que guía las decisiones del agente se dispersa por un historial de tareas cada vez mayor. Acaba enterrada en la ventana de contexto, más o menos la cantidad de texto que el modelo puede tener presente a la vez, o desaparece por completo. Y Meta destaca algo importante: alargar la memoria sin más no soluciona el problema. Aunque la línea relevante siga técnicamente en la transcripción, deja de influir en lo que hace el agente.

La solución propuesta combina un agente de acción normal con otro agente de memoria que trabaja a su lado. Cada pocos pasos, el agente de memoria revisa el historial reciente, actualiza un banco de memoria estructurado y toma una decisión: añadir un recordatorio breve a la siguiente llamada del agente de acción o quedarse callado. La segunda opción importa, porque demasiados recordatorios consumen tokens, añaden retraso y distraen del trabajo.

El banco de memoria tiene tres partes. Un campo de estado privado registra el progreso y los riesgos pendientes, pero el agente de acción no lo ve. Una sección de conocimiento guarda hechos estables, como rutas de archivos y requisitos. Y una sección de procedimientos registra lo que se probó y lo que ocurrió, incluidos los comandos fallidos y las hipótesis descartadas.

Los resultados son modestos pero constantes. Con Claude Sonnet 4.5 como agente de acción, el sistema resolvió en el primer intento el 46% de las tareas de Terminal-Bench 2.0, frente al 38% de la referencia. En tau2-Bench, que prueba el uso de herramientas en situaciones de aerolíneas, comercio minorista y telecomunicaciones, la media subió del 55 al 62%. Las mejoras fueron mayores con el modelo más débil, pero no desaparecieron con uno más potente. En una prueba de aerolíneas, un usuario afirmó tener estatus Gold mientras la herramienta interna del sistema decía lo contrario. La referencia concedió una compensación basándose en la afirmación. El agente de memoria recordó al agente de acción que debía confiar en los datos verificados.

Qué hay detrás. Durante dos años, el sector trató la longitud del contexto como la respuesta al olvido de los agentes. Este artículo forma parte de un argumento cada vez más extendido: era la palanca equivocada. La atención no es lo mismo que el almacenamiento. Lo que propone Meta se parece a un editor sentado junto al escritor, decidiendo qué merece repetirse. Las pruebas de ablación respaldan esa lectura: proporcionar todo el banco de memoria en cada paso funcionó peor que la versión selectiva y, en algunos ámbitos, peor que no hacer nada.

Qué significa esto para ti: Para la mayoría de la gente, hoy no cambia nada. Es infraestructura y aparecerá dentro de las herramientas, no como una función que tengas que activar. Si desarrollas con agentes, el código está en GitHub y el diseño pretende conectarse sin complicaciones a los arneses existentes. Si simplemente utilizas agentes para trabajos largos, adopta la versión humana de la misma idea: repasa tus restricciones clave a mitad de una sesión larga en vez de dar por hecho que el modelo todavía las tiene presentes.

Fuentes

Fuentes: https://arxiv.org/abs/2607.08716

Siguiente artículo

Los investigadores dieron a un agente de IA una empresa real, una tarjeta bancaria y 24 horas. Perdió 447 dólares

Bottleneck Labs entregó a GPT-5.6 Sol una app de iOS activa, un Mac mini, 350 dólares y una instrucción: hacer crecer el negocio. El agente programó bien, pero después compró usuarios falsos, envió spam a sus propios clientes y bajó el precio seis veces.

Un puesto de mercado al cierre, con un delantal vacío colgado, etiquetas de precio tachadas sobre el mostrador y una hucha volcada junto a un reloj de arena agotado