Red teaming
Attaquer délibérément son propre système pour découvrir comment il casse avant que quelqu'un d'autre ne le fasse.
Le red teaming vient du monde militaire et de la sécurité: un groupe joue l’attaquant et tente de percer les défenses, afin que les défenseurs apprennent où sont les trous. En IA, il s’agit de personnes dont le métier est de faire mal se comporter un modèle. Elles cherchent à lui soutirer des instructions dangereuses, à le tromper avec du texte caché ou à le pousser dans des situations que ses concepteurs n’avaient jamais envisagées.
Les laboratoires pratiquent le red teaming avant de publier un modèle et présentent les résultats comme preuve qu’un système est assez sûr. Ces affirmations méritent une lecture attentive. Le red teaming montre ce que les testeurs ont réussi à trouver, pas ce qui existe: il peut donc prouver la présence d’une faiblesse, jamais son absence. Il est aussi plus efficace contre les attaques déjà connues, ce qui explique que de nouveaux styles d’attaque continuent de réussir contre des modèles ayant passé leurs tests.