CourionAI
ES
Boletín
← Todas las noticias
security 3 min de lectura

Los defensores ya utilizan la inyección de prompts como trampa para atacantes con IA

Tracebit ocultó breves cadenas de texto en recursos falsos de la nube para activar las reglas de seguridad del propio modelo de IA atacante. En las pruebas, una sola cadena impidió siempre que Claude Opus 4.8 lograra acceso de administrador.

Ilustración en risografía de una pequeña jaula para pájaros dentro de un laberinto de armarios de servidores, con una araña mecánica inmóvil a medio paso frente a ella

La inyección de prompts suele ser la villana de las historias sobre seguridad de la IA. Es el truco por el que un texto oculto en un documento, una página web o un correo se convierte discretamente en una instrucción que la IA obedece. Los investigadores de la empresa de seguridad Tracebit han utilizado ahora el mismo truco en la dirección contraria, con resultados sorprendentemente sólidos.

El sistema utiliza algo que los defensores ya despliegan: los canarios. Un canario es un señuelo, un recurso falso de la nube, como un depósito de almacenamiento sin usar o unas credenciales de acceso ficticias, que ninguna persona legítima tendría motivos para tocar. Si algo lo lee, se sabe que hay un intruso dentro. Tracebit añadió una vuelta de tuerca ocultando un breve texto en el señuelo, al que llama «bomba de contexto». Cuando un agente de IA atacante husmea y lee ese secreto falso, el texto entra en su contexto, la memoria de trabajo que utiliza para decidir qué hacer después. Está redactado para activar las reglas de seguridad del propio modelo, que se detiene en lugar de continuar.

Las cifras de las pruebas llaman la atención. Tracebit creó una imitación de un entorno corporativo en la nube con diez vías de entrada independientes y realizó 152 intentos con agentes basados en Claude Opus 4.8, Gemini 3.1 Pro, GLM 5.2, DeepSeek 4 Pro y Kimi K2.6. En el entorno limpio, los agentes alcanzaron al menos uno de sus objetivos en el 91 % de las ejecuciones. Con una sola bomba de contexto, la cifra cayó al 15 %. Opus 4.8 consiguió acceso completo de administrador en el 93 % de las ejecuciones limpias y falló todas las veces cuando estaba presente la bomba. Gemini obtuvo acceso completo y una presencia duradera en el 60 % de las ejecuciones limpias, pero también falló con la bomba. Y como cada bomba activada sigue siendo un canario que alguien acaba de leer, el defensor recibe una alerta en ese mismo instante.

Resulta interesante lo que contenían realmente las cadenas. Los investigadores evitaron tanto los temas verdaderamente atroces como los relacionados con la ciberseguridad. Descubrieron que los modelos occidentales se detenían de forma fiable cuando el texto abordaba asuntos biológicos sensibles. Los modelos chinos, cuando se accedía a ellos mediante proveedores chinos, se paraban ante temas políticamente delicados en China escritos en chino. En otras palabras, la defensa dirige contra el modelo su propio entrenamiento de seguridad, por lo que solo será tan duradera como ese entrenamiento. Tracebit reconoce que no ha probado los llamados modelos «abliterated», versiones a las que se han eliminado las barreras de seguridad, así que aún se desconoce si el método funciona contra ellos.

También importa el contexto general. A finales de 2025, el National Cyber Security Centre del Reino Unido advirtió de que quizá la inyección de prompts nunca pueda corregirse como las antiguas vulnerabilidades web, porque los modelos de lenguaje no trazan una línea clara entre datos e instrucciones. La respuesta de Tracebit consiste esencialmente en dejar de luchar contra ese hecho y aprovecharlo.

Qué significa esto para ti: Hoy no hay nada que instalar, y esta técnica está destinada a quienes operan infraestructuras, no a particulares. Pero ofrece un cambio de perspectiva útil: a medida que los atacantes dirigen agentes automatizados contra los sistemas, la posibilidad de convencer a esos agentes para que desistan se convierte en un activo defensivo. Conviene mantener expectativas realistas: esto frena a los atacantes y activa una alarma. Es un cable trampa, no un muro.

Fuentes

Fuentes: https://agentic.tracebit.com/context-bombs/

Siguiente artículo

Un enlace malicioso bastaba para crear un agente de IA que espiaba para un atacante

Zenity Labs demostró cómo un solo enlace de ChatGPT manipulado podía crear un agente autónomo dentro de una empresa, usando los permisos de un empleado y consultando el buzón del atacante cada cinco minutos para recibir órdenes. OpenAI ya corrigió el fallo.

Ilustración en risografía de un sobre abierto con un anzuelo, que se despliega en una cadena de pequeñas siluetas de robots unidas a candados abiertos