El GLM-5.3-Flash de Z.ai se acerca al Opus a una décima parte del precio
Un modelo de peso abierto de 320 mil millones de parámetros con una ventana de contexto de un millón de tokens, lanzado bajo una licencia del MIT a 0,15 dólares por millón de tokens de entrada. Primero pasó una semana en las tablas de clasificación con un nombre falso.
El laboratorio chino Z.ai ha lanzado GLM-5.3-Flash, el modelo de codificación más barato que ha comercializado y el primero de la familia GLM-5 en manejar imágenes y vídeos de forma nativa en lugar de a través de un convertidor incorporado. Los pesos están en Hugging Face bajo una licencia del MIT, que es tan permisiva como las licencias de software, y la versión alojada cuesta 0,15 dólares por millón de tokens de entrada y 0,50 dólares por millón de tokens de salida.
Las especificaciones: 320 mil millones de parámetros totales con 18 mil millones activos por token y una ventana de contexto de 1,048,576 tokens. Los parámetros son los números internos que aprende un modelo durante el entrenamiento; una ficha es aproximadamente un fragmento de palabra; la ventana de contexto es la cantidad de texto que el modelo puede tener en mente a la vez, y un millón de tokens es cómodamente una novela larga o una base de código muy grande. La brecha entre 320 mil millones almacenados y 18 mil millones utilizados es un diseño de mezcla de expertos, donde el modelo mantiene muchas subredes especializadas y solo activa las pocas relevantes para cada fragmento de texto.
En los puntos de referencia, Z.ai informa 84,3 en Terminal-Bench 2.1 frente a 85.0 de Claude Opus 4.8 y 87.4 de GPT-5.6 Terra, y 63.4 en DeepSWE v1.1 frente a 46.2 de GLM-5.2. Las pruebas independientes realizadas por Artificial Analysis le otorgan una puntuación de 57 en su Índice de Inteligencia, muy por encima de la media de 27 para modelos abiertos de tamaño comparable, aunque es lento con 48,7 tokens de salida por segundo y notablemente detallado. Vision es el punto débil: está detrás de Gemini 3.7 Flash en los puntos de referencia de imagen.
Qué está pasando realmente aquí: el modelo pasó su primera semana ejecutándose de forma anónima como “Ox Alpha” en OpenCode y OpenRouter, que es una forma ahora común de obtener reacciones honestas antes de que la marca entre en acción. Lo más interesante es dónde se ejecutó. Z.ai dice que toda la vista previa se sirvió en chips de IA chinos producidos en el país, con un motor de servicio personalizado que informa una mejora triple de extremo a extremo. Esa es la parte que vale la pena ver. La historia del control de exportaciones siempre ha asumido que los laboratorios chinos tienen cuellos de botella en el hardware de Nvidia, y este es un laboratorio que afirma haber enviado un modelo casi fronterizo sin él. Trate la afirmación como informada en lugar de verificada, y recuerde que todos los números de referencia de los titulares son propios de Z.ai con configuraciones por prueba que difieren.
Qué significa esto para ti: si usas IA a través de una ventana de chat, el efecto práctico es una presión a la baja sobre los precios en todas partes, que eventualmente te llegará a ti. Si paga por el acceso a la API, esto es realmente barato para la calidad: aproximadamente $0,045 por tarea en el nivel con descuento. Si esperaba ejecutarlo en casa, modere eso. El punto de control predeterminado de FP8 es de alrededor de 306 GiB antes de la memoria que el modelo necesita mientras se ejecuta, y la ruta de servicio actual quiere chips Nvidia Hopper o más nuevos, por lo que este es un modelo de ocho nodos GPU en lugar de uno de escritorio. Para la mayoría de las personas, la API es la puerta realista, y la licencia abierta es más importante porque significa que nadie puede quitarle el modelo más adelante.
Fuentes
Fuentes: https://z.ai/blog/glm-5.3-flash
Google creó un pequeño modelo de inteligencia artificial que lee rastros de glucosa
GlucoFM tiene 720.000 parámetros, aproximadamente una millonésima parte del tamaño de un modelo de chat, y supera a rivales más grandes en la detección de patrones metabólicos en datos de monitorización continua de glucosa.