Modello di diffusione
Un modello che parte da rumore casuale e lo ripulisce ripetutamente finché non compare un'immagine, un suono o un blocco di testo finito.
La diffusione è la tecnica dietro la maggior parte dei generatori di immagini. L’addestramento procede all’indietro: si prendono immagini vere, si aggiunge rumore finché non restano che disturbi, e si insegna al modello ad annullare ogni passaggio. Eseguendolo al contrario, il modello può partire da puro rumore e raffinarlo, passaggio dopo passaggio, fino a qualcosa che somiglia ai dati di addestramento. Ogni passaggio si chiama fase di riduzione del rumore.
La stessa idea vale ora per il testo. Invece di scrivere una parola dopo l’altra, un modello di diffusione testuale prende un intero blocco di token e lo affina in più passaggi, così può correggere un errore iniziale prima che qualcosa sia definitivo e produrre molti token in parallelo. In cambio, ogni risposta completata richiede più passaggi attraverso la rete, quindi il metodo deve essere efficiente per convenire. DiffusionGemma di Google è un esempio attuale.