Punto de referencia de reconstrucción
Una prueba de 2026 que le da a un modelo solo la lista de referencias de un artículo y le pide que recupere la idea central del artículo, con modelos de frontera con una puntuación del 3 al 15 por ciento.
Reconstruction, publicado en arXiv en agosto de 2026 por un equipo dirigido por Shaolong Chen y Yanlin Fei, prueba si un modelo de lenguaje puede hacer lo específico que define el descubrimiento científico: formar una hipótesis genuinamente nueva a partir de trabajos anteriores. La entrada es deliberadamente escasa. El modelo obtiene la lista de artículos de investigación citados antes de su publicación, y nada más. Sin texto completo, sin nombres de autores, sin pistas posteriores a la publicación.
En 643 artículos en seis campos, siete modelos de frontera recuperaron la idea central entre el 3 y el 15 por ciento de las veces. El diferencial estrecho importa tanto como las cifras bajas, porque si la tarea se resolviera mediante el razonamiento, se esperaría que modelos más sólidos avanzaran claramente. Un proceso de múltiples agentes que tenía varios modelos proponiendo ideas, criticándose entre sí y eliminando a los más débiles a través de un torneo alcanzó entre el 23 y el 42 por ciento, lo que sugiere que la forma útil para el descubrimiento asistido por IA es una estructura que se asemeje a la revisión por pares en lugar de un modelo muy grande. El artículo es una preimpresión y no ha sido revisado por pares.