CourionAI
ES
Boletín
← Todas las noticias
open-weights 3 min de lectura

Qwen3.8-Max de Alibaba pasó 16 días escribiendo una herramienta por sí solo, y los pesos se harán públicos la próxima semana

Alibaba publicó todos los detalles y benchmarks de Qwen3.8-Max, un modelo de 2,4 billones de parámetros creado para tareas que se ejecutan durante días. Cinco estudios de caso cubren codificación autónoma, reproducción en papel, diseño de chips y un año simulado de venta minorista en línea.

Un largo banco de trabajo cubierto por una cadena de pequeños engranajes, compuertas y palancas, con un hilo continuo que recorre toda su longitud y un taburete vacío al lado.

Alibaba ha presentado el panorama completo del Qwen3.8-Max, el modelo insignia que presentó a mediados de julio, y esta vez las cifras y los estudios de caso lo acompañan. El modelo tiene 2,4 billones de parámetros totales con 95 mil millones activos por consulta, y el equipo dice que los pesos aumentarán en Hugging Face y ModelScope la próxima semana. Eso lo convertiría en el primer modelo de la clase Qwen-Max que puede descargar y ejecutar usted mismo.

El discurso no es mejores respuestas a preguntas únicas. Es lo que el campo llama trabajo de largo horizonte, es decir, tareas que se ejecutan durante días a través de cientos de pasos. Alibaba publicó cinco estudios de caso para dejar claro este punto. En el primero, el modelo pasó 16 días construyendo una herramienta de línea de comandos llamada oh-my-cli: convirtió las solicitudes entrantes de los usuarios en problemas de GitHub, se los asignó a sí mismo, escribió el código, ejecutó las pruebas y las iteró. Hasta el 30 de julio, había registrado 265 confirmaciones, 127 solicitudes de extracción y 151 problemas sin que ningún ser humano tocara el teclado. En otro, dado solo un trabajo de investigación y sin código inicial, reprodujo los seis resultados del artículo durante aproximadamente 125 horas de cálculo, luego probó 18 ideas propias y superó al método original en un benchmark matemático por 2,7 puntos.

Dos ejecuciones más prueban la planificación en lugar de la codificación. Cuando se le pidió que diseñara un circuito criptográfico, el modelo partió de un diseño funcional pero inflado que utilizaba 8.298 puertas lógicas, los elementos de conmutación básicos en un chip, y lo redujo a 678 en aproximadamente 500 iteraciones. Después de pasar un diseño automatizado, el área física se redujo en un 81 por ciento. En una simulación de un año fiscal completo de venta minorista en línea, basada en datos anónimos de Taobao y Tmall, comenzó con 100.000 yuanes, negoció con proveedores en lenguaje sencillo, manejó devoluciones y tifones, detectó estafadores escondidos en el grupo de proveedores y terminó con 416.252 yuanes.

Qué hay detrás de esto. Alibaba atribuye el salto a la forma en que ejecutó el aprendizaje por refuerzo, la etapa de capacitación en la que un modelo es recompensado por buenos resultados en lugar de mostrarle respuestas correctas. En lugar de practicar en tareas individuales, practicó en aproximadamente 4000 entornos diferentes que cubrían flujos de trabajo de varios días, carpetas de proyectos anidadas y varios marcos de agentes diferentes. Su índice de puntuación interna en más de diez benchmarks aumentó de 0,474 a 0,725 y luego cayó ligeramente más allá de ese punto. Vale la pena mantener las expectativas firmes: todos estos números son autoinformados a partir de ejecuciones internas, nadie fuera de la empresa los ha verificado y un modelo que cuadruplica el dinero ficticio en una simulación no ha funcionado en una tienda real. El contexto competitivo también importa. El Kimi K3 de Moonshot abrió sus pesas el 27 de julio y las pruebas independientes llevaron sus afirmaciones a la tierra.

Qué significa esto para ti: nada hoy, a menos que alquiles tiempo de GPU por horas. Un modelo de 2,4 billones de parámetros no es algo que se ejecute en una computadora portátil, por lo que, en la práctica, la mayoría de la gente lo encontrará a través de un servicio alojado. Lo que es realmente útil es la opción de compatibilidad: Qwen3.8-Max habla los formatos API de OpenAI y Anthropic, por lo que ingresa a Claude Code, Codex y herramientas similares cambiando una configuración. Si ya paga por token por un agente que realiza trabajos prolongados, esa es una palanca de precios real que vale la pena probar una vez que lleguen los pesos. Si no lo hacen, la señal que hay que sacar es que los campos abiertos y cerrados están ahora aproximadamente a un paso de distancia en lugar de a una generación.

Fuentes

Fuentes: https://qwen.ai/blog?id=qwen3.8

Siguiente artículo

Dos equipos de investigación resolvieron el mismo problema abierto con el mismo modelo de IA, con tres horas de diferencia

Un estudiante de doctorado del MIT y dos profesores resolvieron de forma independiente la misma pregunta sobre criptografía cuántica utilizando GPT-5.6 Sol Ultra y publicaron sus artículos en arXiv con tres horas de diferencia entre sí. Plantea una pregunta incómoda sobre qué significa ahora el descubrimiento independiente.

Dos sobres idénticos sellados con cera llegan a la misma ranura desde lados opuestos en el mismo instante, frente a la esfera de un reloj detenido