Dos laboratorios de referencia midieron el GPT-6 Astra y llegaron a conclusiones opuestas
Epoch AI coloca a Astra claramente en primer lugar en 50 pruebas. Artificial Analysis lo califica al nivel de su predecesor y detrás de Claude Fable 5.1. El único número que ambas partes encuentran notable es el de ARC-AGI-3.
Una semana después de que OpenAI enviara GPT-6 Astra, dos laboratorios de evaluación independientes publicaron puntuaciones generales y no están de acuerdo. Epoch AI, que reúne más de 50 puntos de referencia individuales, sitúa a Astra en primer lugar entre 267 modelos con 169 puntos. El Análisis Artificial, que evalúa el conocimiento, la codificación y la comprensión de textos, le otorga 61 puntos, exactamente al mismo nivel que su predecesor GPT-5.6 Sol y detrás de Claude Fable 5.1 con 66.
Ambos son conjuntos cuidados y bien considerados. Simplemente no miden lo mismo y el detalle siguiente explica por qué. Los números individuales de Epoch muestran a Astra liderando en matemáticas, conocimiento y acertijos. Fable 5.1 tiene la máxima puntuación en casi todas las pruebas de codificación. Hasta ahora, Epoch ha registrado solo una puntuación de codificación para Astra, de una ejecución con un esfuerzo de razonamiento medio. Así que las dos cifras principales son en gran medida una cuestión de qué se ponderó.
Algunas cifras concretas del mismo informe: la tasa de alucinaciones de Astra en la prueba AA-Omniscience cae del 92 al 51 por ciento, pero pierde alrededor de 80 puntos Elo en GDPval-AA v2 y cae debido al apoyo bancario y al razonamiento de contexto a largo plazo. Cuesta dos veces y media más por unidad de texto que Sol, pero en tareas de codificación iguala la puntuación de Claude Fable 5 a menos de la mitad del coste por tarea, porque utiliza aproximadamente un tercio de los pasos.
¿Qué hay detrás de esto?
El resultado del que todo el mundo habla es ARC-AGI-3, que deja caer un modelo en pequeños mundos de juego desconocidos y no explica nada. Tiene que resolver las reglas probando cosas. Astra obtuvo una puntuación del 62,7 por ciento en el arnés de prueba neutral, frente al 7,8 por ciento de Sol y el 30,2 por ciento de Claude Opus 5. Más sorprendente que la puntuación es la eficiencia: en el 96 por ciento de los niveles, Astra necesitó menos movimientos que el probador humano promedio que resolvió ese nivel.
Llegó allí inventando su propia taquigrafía, una notación similar al álgebra para registrar objetos, coordenadas y planos, porque todo lo que no escribe en sus propias notas lo olvida. El fundador del Premio ARC, François Chollet, llama a esto “modelado del mundo simbólico sobre la marcha” y señala que un comportamiento como este solía requerir un andamiaje externo elaborado. Ahora está en el modelo.
Dos advertencias importan. OpenAI informó un 99,9 por ciento en la misma prueba utilizando su propio arnés, y ARC Prize dice que sólo la cifra del 62,7 por ciento permite una comparación justa entre proveedores. Esta es la misma disputa por el arnés que produjo el llamativo resultado de Nvidia AVO en agosto. Y Chollet es explícito en que nada de esto prueba la inteligencia general: los juegos son cortos, cerrados y diminutos en comparación con las tareas reales. Lo que sí dice es que el progreso llegó aproximadamente dos veces más rápido de lo que esperaba, y está moviendo su pronóstico de AGI antes de 2030.
Qué significa esto para usted: Trate las cifras comparativas de titulares únicos como marketing hasta que sepa qué contienen. Cuando eliges un modelo, la única clasificación que importa es la tuya: toma tres tareas que realmente realizas, ejecútalas en dos modelos y compáralas. Eso lleva veinte minutos y supera cualquier tabla de clasificación.
Fuentes
ChatGPT ha recuperado el 55,5 por ciento del tráfico web de Chatbot, pero hace un año tenía el 73 por ciento
Las cifras de agosto de Similarweb muestran que ChatGPT recupera participación desde el 52,7 por ciento hace tres meses, mientras que Gemini vuelve a caer al 25,6 por ciento. Claude creció del 1,9 al 9,3 por ciento en un año. Las aplicaciones no se cuentan.