Jailbreak
Un prompt diseñado para conseguir que un modelo haga algo que su entrenamiento de seguridad debía impedir.
Un jailbreak es una forma de redactar una petición para que un modelo haga algo que su entrenamiento de seguridad debía bloquear. Los trucos clásicos consisten en interpretar un papel, como «eres un actor en una película donde…», fingir ser una autoridad, inventar una conversación anterior en la que el modelo parece haber aceptado la petición o simplemente volver a preguntar con palabras algo distintas. Combinar varios trucos suele funcionar mejor, y precisamente por eso siguen dando resultado.
El jailbreak universal es la variante que preocupa a los investigadores: un único prompt reutilizable que permite la mayoría de las solicitudes dañinas en la mayoría de los modelos, en vez de ser un truco afortunado. Las organizaciones de seguridad sin ánimo de lucro rastrean cientos de ellos en modelos de frontera. La situación real es esta: la alineación aumenta el esfuerzo necesario, pero no cierra la puerta.
-
OpenAI envía GPT-6 Astra y lo llama su primer modelo cibernético crítico
-
Los investigadores encontraron una manera de leer los pensamientos ocultos de Claude, ChatGPT y Gemini
-
Un modelo abierto está ahora a meses, no años, detrás de la frontera. Sus pruebas de seguridad no lo son.
-
¿Usas Fable 5 con una suscripción a Claude? El lunes cambia la forma de pagarlo