CourionAI
ES
Boletín
← Glosario Término

SimpleQA

Un benchmark que hace preguntas factuales breves con una sola respuesta correcta y resulta mucho más difícil para los modelos de lo que parece.

SimpleQA hace exactamente lo que su nombre indica: formula a un modelo preguntas factuales breves y sin ambigüedad y comprueba si la respuesta es correcta. Sin acertijos de razonamiento, código ni ensayos. Solo preguntas como quién hizo qué en qué año.

Los modelos son sorprendentemente malos. A mediados de 2026 las mejores puntuaciones rondaban el 53 %, pese a proceder de modelos capaces de superar casi por completo competiciones matemáticas de nivel olímpico. Esa brecha es la cuestión. Un modelo de lenguaje guarda datos como efecto secundario de aprender a predecir texto, no como una tabla de consulta; introducir más razonamiento en un modelo pequeño tiende a desplazar el recuerdo factual. Es el principal argumento a favor de la recuperación: entregar al modelo el documento fuente en lugar de fiarse de su memoria.