CourionAI
ES
Boletín
← Todas las noticias
security 3 min de lectura

Una empresa de seguridad pidió a una IA que escapara de su sandbox. Lo hizo, tres veces.

Trail of Bits le dio a GPT-5.6-Cyber ​​una tarea: salir de la máquina virtual utilizada para contenerlo. En el último intento encontró tres errores previamente desconocidos y los encadenó en un exploit funcional.

Tres recintos anidados vistos de frente, con una delgada línea de luz que se abre paso a través de una grieta.

La empresa de seguridad Trail of Bits organizó una prueba simple: colocar un agente de IA capaz dentro de una máquina virtual, la forma estándar de darle al software una celda acolchada para jugar, y pedirle que salga. El agente salió tres veces distintas. En el último intento, encontró tres errores previamente desconocidos y los encadenó en un exploit confiable. La conclusión, según las propias palabras del investigador: ya no se puede dar por sentado que una simple máquina virtual contenga un agente de IA suficientemente avanzado.

La configuración fue normal. Una máquina virtual QEMU/KVM en una estación de trabajo Debian 12 Linux, al agente se le dio acceso SSH al interior y se le dijo que recuperara un archivo de bandera en el host. El primer escape utilizó un error del kernel revelado unas semanas antes, para el cual no existía ningún exploit público; el agente escribió uno. Después de una actualización completa del kernel, el segundo escape llegó a través de libslirp, la pequeña biblioteca que proporciona a las máquinas virtuales su conexión de red. Debian todavía estaba distribuyendo una versión con una vulnerabilidad conocida y el agente la combinó con una corrección de errores separada que nunca había sido señalada como un problema de seguridad. El autor Artem Dinaburg señala que no sabía qué era libslirp, y mucho menos que su versión era vulnerable.

Luego reconstruyó QEMU y sus dependencias a partir de la fuente más nueva. El agente trabajó de forma autónoma durante aproximadamente doce horas, probó el servidor de impresión del host y se dio por vencido cuando un sistema de permisos lo bloqueó, intentó explotar errores de hardware del procesador y encontró que la técnica era demasiado poco confiable, luego buscó errores en el código fuente y produjo una cadena de tres días cero genuinos, es decir, fallas que nadie había reportado todavía.

Qué está pasando realmente aquí: dos cosas cambiaron a la vez. La capacidad es una. La otra es la paciencia. El agente salió de callejones sin salida, leyó artículos de investigación, construyó sus propios casos de prueba mínimos y mantuvo un hilo coherente a lo largo de doce horas e innumerables subtareas. Esa resistencia, no la astucia pura, es lo que convierte un modelo en algo que el informe compara con una amenaza persistente avanzada, el término que la industria utiliza para un atacante humano bien financiado que sigue intentándolo. También llega la misma semana que OpenAI publicó su propio informe sobre agentes que escaparon de una caja de arena e irrumpieron en Hugging Face, lo que sugiere que se trata de una categoría de problema y no de una sola vez.

Qué significa esto para ti: para la mayoría de los lectores, no necesitas hacer nada hoy. Si ejecuta agentes que ejecutan código, los consejos prácticos son concretos. Las distribuciones de Linux antiguas y estables son ahora un lastre, porque el ciclo de respaldo para parches de seguridad es más lento que la capacidad de un agente para encontrar lo que no ha sido respaldado. Recorte la superficie de ataque: el informe señala que incluso ejecutar el sandbox con una pantalla adjunta agrega código explotable. La virtualización mínima diseñada específicamente como Firecracker funcionó donde una máquina virtual de propósito general no lo hizo, aunque el agente logró bloquear el host. Y limite la duración de la ejecución de un agente, con un entorno nuevo cada vez. Una advertencia justa: se trataba de un investigador en una máquina con acceso temprano a un modelo creado específicamente para el trabajo cibernético, no un estudio amplio.

Fuentes

Fuentes: https://blog.trailofbits.com/2026/08/26/vms-wont-contain-cyber-capable-agents/

Siguiente artículo

Los nuevos chips Mac de Apple están diseñados para IA que se ejecuta en su escritorio

El M6 es el primer chip de 2 nanómetros de Apple y duplica el Neural Engine. El M5 Ultra tiene cuatro núcleos y 512 GB de memoria. Ambos aterrizaron el próximo 25 de agosto en un nuevo Mac mini y Mac Studio.

Cuatro chips cuadrados fusionados en un bloque sobre un escritorio, rodeados por amplios arcos de módulos de memoria