Un enlace malicioso bastaba para crear un agente de IA que espiaba para un atacante
Zenity Labs demostró cómo un solo enlace de ChatGPT manipulado podía crear un agente autónomo dentro de una empresa, usando los permisos de un empleado y consultando el buzón del atacante cada cinco minutos para recibir órdenes. OpenAI ya corrigió el fallo.
Los investigadores de seguridad de Zenity Labs han publicado un fallo que merece la pena comprender aunque nunca utilice software empresarial. Un solo enlace manipulado de ChatGPT, enviado en un correo de aspecto corriente, bastaba para crear un agente de IA plenamente operativo dentro de una empresa. El agente funcionaba con la identidad del empleado, utilizaba las aplicaciones que este ya había conectado y después consultaba cada cinco minutos el buzón del atacante en busca de nuevas instrucciones. Zenity lo llama AgentForger.
El mecanismo es más sencillo de lo que parece. El creador de agentes de OpenAI aceptaba dos ajustes directamente en la dirección web: la plantilla inicial y las instrucciones para el nuevo agente. La página no se limitaba a pegar esas instrucciones en un cuadro de texto para que el usuario las revisara. Las ejecutaba. Así, un atacante podía escribir toda la configuración como una lista numerada de tareas, ocultarla dentro de un enlace y dejar que el propio navegador de la víctima construyera el agente. Los únicos requisitos eran que la persona hubiera iniciado sesión y autorizado previamente al menos un conector, como Gmail, Outlook, Slack, Drive o Teams. Como esos permisos ya existían, no aparecía una nueva pantalla de consentimiento que despertara sospechas.
Las instrucciones también cambiaban todas las solicitudes de aprobación a «no preguntar nunca» y programaban el agente para que se ejecutara periódicamente. En la demostración de Zenity, el agente trazó un mapa de toda la organización mediante Outlook, Slack, Teams, Drive y Calendar, encontró el usuario y la contraseña de una base de datos en un mensaje de Slack y envió ambos por correo al atacante. También mandó mensajes desde la cuenta de la víctima pidiendo a sus compañeros que confirmaran un inicio de sesión en una página controlada por el atacante.
Lo que convierte esto en algo más que un fallo aislado es el patrón. Zenity describe los ingredientes como una combinación letal: una entrada no fiable procedente del exterior, acceso a datos privados mediante conectores y una vía para enviar esos datos fuera. La mayoría de los ataques debe superar las solicitudes de aprobación que deberían detectarlos. AgentForger no lo necesitaba porque utilizaba la herramienta que configura esas solicitudes. El software de seguridad tradicional vigila a usuarios y dispositivos, no a agentes que actúan a través de la identidad legítima de un usuario.
Hay una noticia realmente buena. Zenity comunicó el fallo mediante el programa de recompensas de OpenAI el 4 de junio; OpenAI lo confirmó al día siguiente y publicó una corrección el 8 de junio eliminando el parámetro problemático del enlace. Los investigadores elogiaron la rapidez de la respuesta.
Qué significa esto para ti: No hay nada que actualizar, pero sí un hábito que merece la pena adoptar. Trate un enlace que abre una herramienta de IA con un prompt ya rellenado como trataría una factura inesperada: léalo antes de permitir que se ejecute. Si utiliza en el trabajo asistentes con cuentas conectadas, mantenga activadas las solicitudes de aprobación aunque resulten molestas y revise de vez en cuando su cuenta en busca de agentes, automatizaciones o tareas programadas que no recuerde haber creado. Cuanto más pueda hacer un asistente sin preguntar, más daño puede causar cuando otra persona aporta las instrucciones.
Fuentes
Fuentes: https://labs.zenity.io/p/agentforger-part-1-chatgpt-cross-site-agent-forgery
Opus 5 de Anthropic es más pequeño y barato, pero supera a su hermano mayor
Anthropic lanzó Opus 5 el 24 de julio. La sorpresa no es la potencia bruta, sino el precio: iguala o supera ligeramente al más caro Fable 5 en varias pruebas y cuesta menos utilizarlo.