CourionAI
IT
Newsletter
← Glossario Termine

Allineamento dell’IA

Il lavoro volto a far sì che un modello si comporti effettivamente come intendono i suoi creatori, compreso il rifiuto di richieste dannose.

Allineamento è il nome generico per far sì che un modello si comporti nel modo inteso dai suoi creatori. Un modello grezzo addestrato sul testo continuerà felicemente qualsiasi frase che gli dirai, comprese quelle spiacevoli. L’allineamento è la formazione extra che insegna ad essere d’aiuto, a rifiutare richieste pericolose, ad ammettere l’incertezza e a evitare gli stereotipi. La formazione sul rifiuto, in cui una modella impara a dire di no a determinate richieste, ne fa parte.

La parte imbarazzante è che l’allineamento è uno strumento ottuso. Insegnare a un modello a evitare un fallimento spesso ne crea un altro: uno studio del 2026 ha scoperto che i modelli addestrati a evitare gli stereotipi di genere finivano per cancellare quasi completamente i personaggi femminili, preferendo invece “quello”. Anche l’allineamento non è la stessa cosa della sicurezza, poiché le richieste di jailbreak possono aggirarlo e scompare completamente se qualcuno scarica i pesi di un modello e li riqualifica.