CourionAI
IT
Newsletter
← Glossario Termine

Red teaming

Attaccare deliberatamente il proprio sistema per scoprire come si rompe prima che lo faccia qualcun altro.

Il red teaming viene dalla pratica militare e della sicurezza: un gruppo fa l’attaccante e prova a bucare le difese, così che i difensori scoprano dove sono i buchi. Nell’IA significa persone il cui mestiere è far comportare male un modello. Cercano di indurlo a fornire istruzioni pericolose, di ingannarlo con testo nascosto o di spingerlo in situazioni che i suoi progettisti non avevano mai considerato.

I laboratori fanno red teaming prima di rilasciare un modello e presentano i risultati come prova che un sistema è abbastanza sicuro. Vale la pena leggere quelle affermazioni con attenzione. Il red teaming mostra ciò che i tester sono riusciti a trovare, non ciò che esiste: può quindi dimostrare che una debolezza c’è, mai che non c’è. Inoltre tende a essere più efficace contro attacchi già noti, ed è per questo che nuovi stili di attacco continuano a riuscire contro modelli che avevano superato i test.