CourionAI
IT
Newsletter
← Glossario Termine

Punto di riferimento per la ricostruzione

Un test del 2026 che fornisce a un modello solo l'elenco di riferimenti di un articolo e gli chiede di recuperare l'idea centrale dell'articolo, con i modelli di frontiera che ottengono un punteggio compreso tra il 3 e il 15%.

La ricostruzione, pubblicata su arXiv nell’agosto 2026 da un team guidato da Shaolong Chen e Yanlin Fei, verifica se un modello linguistico può fare la cosa specifica che definisce la scoperta scientifica: formare un’ipotesi genuinamente nuova dal lavoro precedente. L’input è volutamente scarno. Il modello ottiene l’elenco degli articoli citati da un documento di ricerca prima della pubblicazione e nient’altro. Nessun testo completo, nessun nome dell’autore, nessun indizio successivo alla pubblicazione.

In 643 articoli in sei campi, sette modelli di frontiera hanno recuperato l’idea centrale tra il 3 e il 15% delle volte. Lo spread ristretto conta tanto quanto i numeri bassi, perché se il compito venisse risolto ragionando ci si aspetterebbe che i modelli più forti andassero nettamente avanti. Una pipeline multi-agente in cui diversi modelli proponevano idee, si criticavano a vicenda ed eliminavano i più deboli attraverso un torneo ha raggiunto una percentuale compresa tra il 23 e il 42%, il che suggerisce che la forma utile per la scoperta assistita dall’intelligenza artificiale è una struttura che assomiglia alla peer review piuttosto che un modello molto grande. Il documento è una prestampa e non è stato sottoposto a revisione paritaria.