CourionAI
FR
Newsletter
← Glossaire Terme

FlashAttention

Une technique largement utilisée qui accélère considérablement l’étape d’attention d’un transformateur en déplaçant moins de données sur le GPU.

L’attention est la partie d’un transformateur où chaque jeton examine tous les autres jetons pour décider de ce qui compte. Fait naïvement, il produit une table intermédiaire géante et passe ensuite la plupart de son temps à mélanger cette table entre la mémoire rapide et la mémoire lente de la carte graphique. FlashAttention réorganise le calcul afin que la table ne doive jamais être écrite dans son intégralité, ce qui signifie le même résultat avec une fraction du trafic mémoire.

C’est l’une de ces rares optimisations qui a changé ce qui était pratique plutôt que ce qui était rapide : des fenêtres contextuelles plus longues sont devenues abordables en grande partie grâce à cela. Les versions successives, jusqu’à FlashAttention-4, constituent la référence par rapport à laquelle tout nouveau noyau d’attention est mesuré.