Modèle de diffusion
Un modèle qui part d'un bruit aléatoire et le nettoie par étapes jusqu'à faire apparaître une image, un son ou un bloc de texte fini.
La diffusion est la technique derrière la plupart des générateurs d’images. L’entraînement se fait à rebours: on prend de vraies images, on y ajoute du bruit jusqu’à obtenir de la neige, et on apprend au modèle à défaire chaque étape. Exécuté en sens inverse, le modèle peut alors partir d’un bruit pur et l’affiner, passe après passe, jusqu’à quelque chose qui ressemble aux données d’entraînement. Chaque passe s’appelle une étape de débruitage.
La même idée s’applique désormais au texte. Au lieu d’écrire un mot après l’autre, un modèle de diffusion textuelle prend un bloc entier de tokens et l’affine en plusieurs passes, ce qui lui permet de corriger une erreur précoce avant que rien ne soit définitif et de produire de nombreux tokens en parallèle. En contrepartie, chaque réponse achevée nécessite plusieurs passages dans le réseau: la méthode doit donc être efficace pour être rentable. DiffusionGemma, de Google, en est un exemple actuel.