ARC-AGI-3
Un punto de referencia de acertijos que prueba si un modelo puede inferir reglas que nunca antes había visto.
ARC-AGI-3 es la tercera generación de una prueba de la ARC Prize Foundation y no está destinada a ser memorizada. Para acertijos de cuadrícula simples, la regla debe derivarse de unos pocos ejemplos que no se parezcan a los datos de entrenamiento. La gente los resuelve con bastante facilidad, pero los modelos tardan mucho tiempo en hacerlo.
En 2026 los valores aumentaron significativamente. Sin embargo, dependen en gran medida del arnés: el mismo modelo logró un 7,8 y un 38,3 por ciento con diferentes marcos de prueba. Por lo tanto, el Premio ARC requiere una estructura estándar, mientras los laboratorios discuten sobre posibles desventajas. Los resultados muestran un progreso real, pero son deficientes para clasificar con precisión dos modelos.
-
Dos laboratorios de referencia midieron el GPT-6 Astra y llegaron a conclusiones opuestas
-
Google excluye su propio modelo de las preguntas del examen
-
El mismo modelo obtuvo una puntuación del 30 por ciento solo y del 100 por ciento dentro del sistema de agentes de Nvidia
-
OpenAI y Anthropic discuten por un benchmark, y la disputa resulta más útil que los resultados