FP8
Una forma compacta de guardar los números de un modelo con ocho bits por valor, lo que reduce a la mitad la memoria frente al antiguo estándar de 16 bits.
Cada peso de un modelo es un número, y se puede elegir cuántos bits dedicar a cada uno. Durante años, el valor habitual fue de 16 bits. FP8 utiliza ocho, por lo que el mismo modelo ocupa la mitad de memoria y se desplaza por el chip aproximadamente al doble de velocidad, a cambio de perder algo de precisión.
Los chips modernos incorporan hardware específico para FP8. Por eso, los modelos abiertos más recientes, como los de DeepSeek, suelen distribuirse directamente en este formato en vez de comprimirse después. El problema está en la compatibilidad: no todas las tarjetas ni todos los sistemas de inferencia admiten cada variante de FP8. Esa diferencia explica con frecuencia que un modelo funcione en una GPU y ni siquiera arranque en otra.
-
Los pesos del GLM-5.3 están disponibles, con dos semanas de retraso y después de una revisión de seguridad
-
El GLM-5.3-Flash de Z.ai se acerca al Opus a una décima parte del precio
-
El próximo modelo abierto de Alibaba es una vista previa de Qwen 4
-
Qwen3.8-27B ya está disponible y funciona en una sola tarjeta gráfica de juegos
-
Alguien ejecutó DeepSeek V4 Flash en producción en una sola tarjeta AMD y publicó todos los parches necesarios