Contaminación de referencia
Cuando las preguntas de una prueba se han filtrado a los datos de entrenamiento de un modelo, una puntuación alta refleja memoria más que capacidad.
Se supone que los puntos de referencia miden lo que un modelo puede funcionar. La contaminación es lo que sucede cuando las respuestas estuvieron contenidas en los datos de entrenamiento todo el tiempo, por lo que el modelo reconoce la pregunta en lugar de resolverla. Debido a que los modelos se entrenan en enormes fragmentos de la web pública, y debido a que los puntos de referencia se publican en la web pública, esto sucede constantemente y, a menudo, es imposible demostrarlo después del hecho.
El efecto práctico es una inflación de puntajes que parece un progreso. Un estudio de 2026 de 60 puntos de referencia encontró que casi la mitad mostraba signos de saturación, lo que significa que las puntuaciones se habían agrupado cerca de la cima de una manera que ya no separaba los modelos fuertes de los débiles. La solución es un diseño resistente a la contaminación: use material publicado después del corte de entrenamiento, elimine los detalles de identificación que permitirían a un modelo reconocer la fuente y congele cada caso de prueba. El punto de referencia de Reconstrucción, publicado en agosto de 2026, es un ejemplo estricto, y los modelos de frontera obtuvieron puntuaciones mucho más bajas que en pruebas comparables con datos más ricos.