CourionAI
IT
Newsletter
← Glossario Termine

Valutazione in doppio cieco

Un test di intelligenza artificiale in cui il valutatore non vede mai il modello e il proprietario del modello non vede mai le domande.

Prendendo in prestito dalla medicina, dove né il paziente né il medico sanno chi ha preso il vero farmaco, una valutazione dell’intelligenza artificiale in doppio cieco mantiene entrambe le parti all’oscuro del materiale dell’altra. L’organizzazione che esegue il test non vede mai i pesi del modello e l’azienda che ha creato il modello non vede mai le domande del test. Il punto è fare in modo che un punteggio significhi qualcosa per un estraneo.

Senza di esso si ottiene un problema familiare. Se un laboratorio può vedere l’esame, può prepararsi per l’esame, e nessuno all’esterno può distinguere un modello veramente capace da uno ben addestrato. Contratti e promesse di divieto di disboscamento erano la vecchia risposta, che equivaleva a fiducia. Google DeepMind ha condotto la prima valutazione di questo tipo di un modello di frontiera proprietario con il Singapore AI Safety Institute nell’agosto 2026, imponendo la separazione con l’informatica riservata anziché una promessa.