CourionAI
ES
Boletín
← Todas las noticias
security 3 min de lectura

Los investigadores cifraron el ataque para que Grok no pudiera leerlo. Grok lo descifró él mismo

Adversa AI ocultó instrucciones en una página web usando AES-256. La propia zona de pruebas de código de Grok los desbloqueó y luego filtró el historial de chat del usuario. Informado en junio, aún sin parchear.

Un candado que se abre con una garra mecánica rodeada de puntos binarios

Los investigadores de seguridad de Adversa AI han publicado un ataque que convierte una solicitud ordinaria en una fuga de datos. Pídale a Grok de xAI que resuma una página web, y si esa página lleva una carga útil especialmente preparada, Grok puede terminar enviando su nombre, ubicación aproximada, nivel de suscripción e historial de conversaciones actual a un servidor del que nunca ha oído hablar. No es necesario hacer clic.

La parte inteligente es cómo la carga útil supera las defensas. Los chatbots que navegan por la web tienen filtros que buscan instrucciones sospechosas ocultas en el texto de la página, la clásica inyección de aviso. La respuesta de Adversa fue hacer que las instrucciones fueran ilegibles: la carga útil está cifrada con AES-256-GCM, un cifrado seguro estándar, y la página también proporciona la clave. Los filtros de seguridad ven galimatías y las dejan pasar. Luego, Grok, que tiene un entorno limitado de Python incorporado para ejecutar código, descifra diligentemente el blob. Lo que sale es texto sin formato producido dentro de su propio entorno de ejecución, y el modelo lo trata como un contexto interno confiable en lugar de contenido no confiable del sitio web de un extraño. Los investigadores lo llaman inyección de contexto criptográfico.

En aproximadamente 20 intentos desde junio, la tasa de éxito reportada fue de alrededor del 40 por ciento, y las fallas causadas por el descifrado salieron mal en lugar de que alguna defensa lo detectara. Adversa informó la falla a xAI a través de su programa HackerOne el 3 de junio de 2026, realizó un seguimiento el 4 y 10 de agosto y dice que no ha recibido respuesta. Al 19 de agosto no había ningún parche ni CVE. El mismo artículo muestra una manifestación relacionada contra Gemini de Google en modo de pensamiento profundo.

El problema subyacente es estructural y no es exclusivo de Grok. Cada modelo que navega por la web y ejecuta código tiene la misma forma: el contenido llega de una fuente que no es confiable y en algún punto posterior el sistema deja de tratarlo como no confiable. Los filtros que escanean el texto entrante en busca de instrucciones incorrectas solo funcionan si las instrucciones están visibles en el momento del escaneo. Cualquier cosa que reconstituya el texto posteriormente, ya sea descifrando, decodificando o ensamblando fragmentos, pasa de largo. Esta es la misma clase de falla detrás de la falla de Copilot que cubrimos el 20 de agosto, donde un enlace encadenaba un parámetro de URL, una recuperación y una memoria persistente en un robo de datos con un solo clic que Microsoft tardó ocho meses en solucionar. La inyección rápida no es un error que se corrige una vez. Es una propiedad de los sistemas que mezclan instrucciones y datos en el mismo canal, y seguirá resurgiendo con ropa nueva.

Qué significa esto para ti: ten cuidado con lo que le pides a un asistente de navegación que lea mientras hay una conversación confidencial abierta en la misma sesión. La exposición aquí es su contexto de chat actual, por lo que la defensa práctica es la separación: comience una nueva conversación antes de señalarle a un asistente una página desconocida y no pegue contraseñas, contratos o datos personales en una sesión que también usa para resúmenes web. La misma precaución se aplica a cualquier agente con navegación y ejecución de código, no solo a Grok. Y si está evaluando herramientas de inteligencia artificial para una empresa, un proveedor que pasa once semanas sin responder un informe de HackerOne es en sí mismo un dato.

Fuentes

Fuentes: https://thehackernews.com/2026/08/new-cryptographic-context-injection.html

Siguiente artículo

El mismo modelo obtuvo una puntuación del 30 por ciento solo y del 100 por ciento dentro del sistema de agentes de Nvidia

El AVO de Nvidia superó los 183 niveles de ARC-AGI-3 utilizando Claude Opus 5, un modelo que obtiene una puntuación de alrededor del 30 por ciento por sí solo. Lo interesante no es el resultado, sino lo que cambió.

Un laberinto que se resuelve mediante un brazo mecánico que alcanza un objetivo en el centro.