El próximo modelo abierto de Alibaba es una vista previa de Qwen 4
Qwen3.8-Flash-Next es un modelo abierto de 125 mil millones de parámetros que solo utiliza seis mil millones de ellos por palabra. Aterriza hoy y está construido sobre la arquitectura detrás de la próxima familia Qwen 4.
Alibaba puso un cronómetro de cuenta regresiva en su plataforma ModelScope el 25 de agosto para Qwen3.8-Flash-Next, un nuevo modelo de peso abierto que se lanzará hoy, 26 de agosto. Peso abierto significa que los archivos del modelo en sí se publican, por lo que cualquiera puede descargarlos y ejecutarlos en lugar de acceder al modelo únicamente a través de una interfaz paga. Lo interesante no es el modelo sino lo que muestra: Alibaba dice que está construido sobre la arquitectura de la familia Qwen 4 de próxima generación.
Las especificaciones informadas, recopiladas por la comunidad del listado de ModelScope antes del lanzamiento: aproximadamente 125 mil millones de parámetros totales más alrededor de 51 mil millones en un componente de incrustación de N-gram separado, con solo alrededor de 6 mil millones de parámetros activos para cualquier token determinado. Los parámetros son los números internos que un modelo aprende durante el entrenamiento, y un token es aproximadamente una palabra o un fragmento de palabra. Esa brecha entre 125 mil millones almacenados y 6 mil millones utilizados es la característica definitoria de un diseño mixto de expertos, donde el modelo mantiene muchas subredes especializadas y solo activa las pocas relevantes para cada fragmento de texto. El modelo es multimodal, lo que significa que maneja imágenes además de texto y, según se informa, introduce dos cambios arquitectónicos con los inútiles nombres de arquitectura híbrida GDN y Qwen Sparse Attention. Los equipos de herramientas, incluido Unsloth, han estado preparando el soporte del día cero, y se esperan tanto una versión estándar como una FP8, siendo FP8 un formato numérico comprimido que aproximadamente reduce a la mitad el uso de memoria.
Lo que realmente está pasando aquí: el truco de la mezcla de expertos es la razón por la cual un modelo tan grande merece la atención de cualquiera fuera de un centro de datos. Ejecutar un modelo denso de 125 mil millones de parámetros requiere hardware serio; ejecutar uno que solo activa 6 mil millones a la vez está mucho más cerca de lo que puede manejar una computadora de escritorio bien equipada, manteniendo al mismo tiempo la amplitud de conocimientos que proviene del tamaño completo. Esa es la misma apuesta que hacen ahora casi todos los laboratorios. Publicar una vista previa de una arquitectura inédita como peso abierto también es una estrategia deliberada más que generosidad: obtiene el ecosistema de herramientas de código abierto, las personas que escriben el software que hace que los modelos sean realmente ejecutables, trabajando en el soporte de Qwen 4 antes de que Qwen 4 exista.
Qué significa esto para ti: si usas IA a través de una ventana de chat, esto no cambia nada hoy, aunque alimenta la tendencia general de mejorar las opciones gratuitas. Si ejecuta modelos en su propia máquina, este es el lanzamiento que debe observar esta semana, con la honesta advertencia de que todas las especificaciones anteriores provienen de una página de avance y análisis de la comunidad en lugar de una tarjeta de modelo publicada, y que el soporte desde el primer día en herramientas como Ollama y LM Studio generalmente demora unos días en estabilizarse. Espere los primeros resultados de pruebas comparativas independientes antes de reorganizar su configuración.
Fuentes
Fuentes: https://modelscope.cn/models/Qwen/Qwen3.8-Flash-Next
Los datos de empleo de Stanford dicen que la brecha entre los trabajadores jóvenes sigue ampliándose
La actualización de agosto de Canarias en el documento Coal Mine sitúa el empleo de personas de 22 a 25 años en trabajos expuestos a la IA un 19 por ciento por debajo de sus pares, frente al 13 por ciento. Los trabajadores de mayor edad no muestran esa brecha.