← Glosario Término
Decodificación especulativa
Un método de aceleración en el que un modelo pequeño predice texto y un modelo más grande lo verifica.
Los modelos de lenguaje suelen escribir tokens uno a la vez. En la decodificación especulativa, un modelo pequeño y rápido adivina varias fichas por delante; el grande revisa la pila de una vez. Quedan sugerencias correctas; los incorrectos son corregidos por el modelo grande.
Probar es más barato que producir. Esto hace que las respuestas sean más rápidas sin cambiar el resultado del modelo grande. El proceso contribuye a la caída de los precios de la IA en segundo plano: sólo es visible en una factura más pequeña y un cursor que parpadea durante menos tiempo.
Mencionado en