El texto invisible en un correo electrónico engañó a un resumidor de IA en las 10 ejecuciones
Forcepoint ocultó instrucciones en un correo electrónico utilizando texto blanco con tamaño de fuente cero. El lector no vio nada inusual. El resumen de AI informó una factura falsa de 46.200 euros y una fecha límite falsa, cada vez.
Los investigadores de seguridad de Forcepoint crearon un pequeño resumen de correo electrónico con IA, el tipo de herramienta que se encuentra en su bandeja de entrada y le brinda una versión de dos líneas de un mensaje largo. Luego le enviaron un correo electrónico con instrucciones escondidas en su interior. El lector vio un recordatorio de factura normal. La IA leyó algo completamente diferente y produjo un resumen con la cantidad incorrecta, la fecha límite incorrecta y faltaba un nombre. En diez de cada diez carreras.
El truco es casi aburridamente simple. El atacante envolvió un párrafo de instrucciones en inglés sencillo en HTML con el estilo font-size:0px; color:#ffffff; altura de línea: 0. Texto blanco, altura cero, invisible en Outlook. Pero el estilo sólo afecta lo que ven tus ojos. El texto sin formato todavía viaja con el mensaje y el resumidor recibió el texto sin formato. De los 1.009 caracteres pasados al modelo, 537 eran visibles para el humano y 472 eran la inyección oculta.
Los resultados se midieron correctamente, con los criterios de aprobación y falla escritos antes de que comenzaran las pruebas. El correo electrónico limpio produjo el resumen correcto las diez veces. El correo electrónico inyectado mencionaba un importe de factura falso de 46.200 euros y una fecha límite falsa del 3 de septiembre diez de cada diez veces, pero siempre omitía la fecha límite real y el nombre real del contacto. Las instrucciones ocultas también le decían al modelo que no mencionara el aviso, y éste obedeció: ningún resumen insinuaba que algo hubiera sido manipulado. El resumidor se ejecutó en claude-haiku-4-5, y Forcepoint espera el mismo resultado de cualquier modelo en un proceso construido de esta manera.
Qué está pasando realmente aquí: se trata de una inyección de prompts indirecta, un problema que Simon Willison mencionó en 2022 y que se encuentra en la parte superior de la lista de riesgos de OWASP para modelos de lenguaje. Un modelo de lenguaje no tiene una forma confiable de diferenciar entre “contenido que debo resumir” e “instrucciones que debo seguir”. Solo ve un largo bloque de texto. Cuando pegas un correo electrónico, una página web o un PDF en un modelo, todo lo escrito allí recibe una votación sobre lo que hará el modelo a continuación. Forcepoint creó deliberadamente la versión más vulnerable posible, sin barreras de seguridad, sin separación entre los encabezados y el cuerpo del correo electrónico, y con un mensaje de sistema de una sola línea. Ese es el objetivo del experimento: muestra lo que sucede cuando nadie pensó en ello, lo que describe muchas características de IA construidas rápidamente.
Qué significa esto para usted: si utiliza una función de resumen de IA para el correo electrónico, trate el resumen como una conveniencia, no como un registro. Antes de pagar una factura, aceptar una fecha límite o reenviar algo, abra el mensaje original y lea los números usted mismo. Ese único hábito derrota todo este ataque. Si crea estas herramientas, las soluciones son conocidas: pasar al modelo solo el texto que realmente se muestra al usuario, mantener los encabezados y el cuerpo separados, marcar todo lo recuperado desde el exterior como no confiable y nunca permitir que un resumidor realice acciones en un buzón. Vale la pena saber que este fue un mensaje, un modelo, diez ejecuciones a temperatura cero, por lo que es una demostración clara en lugar de una medición de qué tan común es el ataque en la naturaleza. Forcepoint ha encontrado por separado cargas útiles de inyección reales, por lo que tampoco es hipotética.
Fuentes
Fuentes: https://www.forcepoint.com/blog/x-labs/html-payload-hijacks-email-summarizer
80 artistas británicos piden una cosa: propiedad legal de su propia voz
Actores y músicos, incluidos Hugh Bonneville y Nicola Coughlan, quieren que se agregue la voz a los derechos legales en el Reino Unido, como ya lo es un nombre o una imagen. La campaña cita al 28 por ciento de los adultos del Reino Unido que son objeto de estafas de clonación de voz.