FlashAtención
Una técnica ampliamente utilizada que acelera mucho el paso de atención de un transformador al mover menos datos en la GPU.
La atención es la parte de un transformador donde cada token mira a los demás para decidir qué importa. Hecho ingenuamente, produce una tabla intermedia gigante y luego pasa la mayor parte del tiempo barajando esa tabla entre la memoria rápida y lenta en la tarjeta gráfica. FlashAttention reorganiza el cálculo para que nunca sea necesario escribir la tabla en su totalidad, lo que significa el mismo resultado con una fracción del tráfico de memoria.
Es una de esas raras optimizaciones que cambiaron lo que era práctico en lugar de solo lo rápido: las ventanas de contexto más largas se volvieron asequibles en gran parte gracias a ello. Las versiones sucesivas, hasta FlashAttention-4, son la base con la que se mide cualquier nuevo núcleo de atención.