Red teaming
Atacar deliberadamente el propio sistema para descubrir cómo se rompe antes de que lo haga otro.
El red teaming viene de la práctica militar y de seguridad: un grupo hace de atacante e intenta atravesar las defensas para que los defensores aprendan dónde están los agujeros. En IA significa personas cuyo trabajo es lograr que un modelo se porte mal. Intentan convencerlo de dar instrucciones peligrosas, engañarlo con texto oculto o empujarlo a situaciones que sus diseñadores nunca contemplaron.
Los laboratorios hacen red teaming antes de publicar un modelo y presentan los resultados como prueba de que el sistema es lo bastante seguro para lanzarse. Conviene leer esas afirmaciones con atención. El red teaming muestra lo que los evaluadores lograron encontrar, no lo que existe, así que puede demostrar que hay una debilidad pero nunca que no la hay. Además tiende a ser más fuerte frente a ataques ya conocidos, y por eso los estilos de ataque nuevos siguen funcionando contra modelos que superaron sus pruebas.