← Glosario Término
GPQA
Un benchmark difícil de preguntas científicas para expertos, utilizado para probar el razonamiento de la IA.
GPQA reúne preguntas científicas de nivel avanzado, diseñadas para resultar realmente difíciles incluso a especialistas y no poder resolverse con una simple búsqueda web. Los laboratorios lo utilizan para medir si un modelo razona de verdad en vez de limitarse a recordar datos.
Una puntuación GPQA alta indica que el modelo puede manejar material especializado exigente. Como todos los benchmarks, mide una capacidad estrecha y no debe confundirse con inteligencia general.
Mencionado en
-
El nuevo modelo de Sakana no es un modelo, es un despachador de otros modelos
-
El laboratorio de Mira Murati reduce su modelo a menos de un tercio y solo pierde un punto
-
Un modelo abierto alemán contenía respuestas de pruebas en sus datos de entrenamiento, y lo sabemos gracias a su apertura
-
El nuevo modo de voz de ChatGPT puede escuchar y hablar al mismo tiempo