El modelo más nuevo de Alibaba obtiene una puntuación más alta y adivina más: la tasa de alucinaciones salta del 23 al 40 por ciento
Qwen3.8 Max ganó 10 puntos en el Índice de Inteligencia de Artificial Analysis, igualando a Claude Opus 4.8. También se volvió más lento, más costoso por tarea y mucho más dispuesto a inventar una respuesta en lugar de admitir que no lo sabe.
El Qwen3.8 Max de Alibaba obtiene una puntuación de 56 en el Índice de Inteligencia de Artificial Analysis, un salto de 10 puntos sobre su predecesor Qwen3.7 Max y suficiente para igualar al Claude Opus 4.8. En GDPval-AA, un benchmark construido en torno a tareas laborales realistas, saltó 468 puntos Elo a 1.739, superando a Kimi K3 y dejando solo a Claude Opus 5 por delante. Se trata de un paso realmente grande en una sola versión.
Ahora el resto de la mesa. Kimi K3 todavía obtiene un punto más, 57, y lo hace por alrededor de un 25 por ciento menos de dinero. Y la forma en que Qwen3.8 Max obtiene su puntuación es costosa: toma 64 pasos por tarea donde la versión anterior tomaba 14, y el texto de entrada que procesa se multiplicó por quince, porque cada paso reenvía toda la conversación hasta el momento. Alibaba redujo sus precios: los insumos cayeron de 2,50 a 2,00 dólares por millón de tokens y la producción de 7,50 a 6,00, y el costo por tarea aún se duplicó con creces, de 0,53 a 1,14 dólares. Kimi K3 cuesta 0,86, GLM-5.2 cuesta 0,57.
También retrocedieron dos puntuaciones. AA-LCR, que prueba si un modelo puede reunir datos dispersos en un documento muy extenso, cayó 2 puntos. AA-Omniciencia cayó 10. Ese segundo es el número interesante, por lo que mide.
¿Qué está pasando realmente aquí?
AA-Omniscience no se limita a preguntar si un modelo responde correctamente. También premia decir “no lo sé”. Qwen3.8 Max acertó alrededor del 31 por ciento de las respuestas, aproximadamente lo mismo que antes. Pero su tasa de alucinaciones, la proporción de respuestas que estaban claramente equivocadas en lugar de disminuir, aumentó del 23 al 40 por ciento. En términos sencillos: no adquirió más conocimientos, sino más audacia. Ahora adivina en situaciones en las que la versión anterior habría admitido un hueco.
Esa compensación es fácil de producir por accidente. Entrenar un modelo para que sea más útil, más persistente y mejor en tareas largas de varios pasos lo empuja a producir siempre algo. El mismo instinto que lo hace avanzar 64 pasos para terminar un trabajo también lo hace completar un hecho que no tiene. Este es un buen ejemplo de por qué un número de título nunca describe un modelo y por qué la métrica que debería interesarle depende completamente de para qué la use.
Qué significa esto para ti: si eliges un modelo, mira más allá de la puntuación principal y observa dos aspectos: el coste por tarea completada, no el precio por millón de tokens, y cómo responde cuando desconoce algo. Para investigaciones, resúmenes de documentos o decisiones reales, un modelo que admite sus lagunas vale más que otro con dos puntos adicionales. En trabajos largos y estructurados cuyo resultado vas a comprobar de todos modos, un modelo exhaustivo aunque caro puede encajarte. Utilices el que utilices, interpreta el tono seguro como un estilo de escritura, no como una prueba.
Fuentes
Cuando AI escribe un cuento infantil sobre animales, los personajes femeninos casi desaparecen
Un estudio de la Universidad de Washington completó casi 24.000 historias a través de seis modelos líderes. El dos por ciento de los personajes animales eran femeninos, el 41 por ciento masculinos y el 57 por ciento neutrales o sin género. Los investigadores argumentan que las barreras destinadas a evitar el sesgo lo causaron.