CourionAI
IT
Newsletter
← Tutte le notizie
research 3 min di lettura

Fornisci al modello di frontiera solo una bibliografia e chiedi l'idea. Ci arriva dal 3 al 15 per cento delle volte

Un nuovo benchmark chiamato Reconstruction elimina tutto tranne l'elenco di riferimenti di un articolo e chiede ai modelli di recuperare i risultati principali. Sette modelli di frontiera hanno ottenuto tra il 3 e il 15%. Un torneo multi-agente ha raggiunto quota 42.

Un foglio di carta vuoto nella parte superiore, con un fitto blocco di brevi barre bibliografiche in basso e il contorno tratteggiato di una lampadina nello spazio vuoto

Un benchmark pubblicato su arXiv il 17 agosto definisce i modelli linguistici un compito che sembra quasi facile e si rivela non esserlo. Prendi un documento di ricerca. Elimina tutto tranne l’elenco delle opere citate prima della pubblicazione. Consegna un modello che elenca l’elenco e chiedigli di recuperare l’idea centrale del documento. In 643 articoli in sei campi scientifici, sette modelli di frontiera hanno gestito tassi di corrispondenza tra il 3 e il 15%. Il punto di riferimento, di un team guidato da Shaolong Chen e Yanlin Fei, si chiama Ricostruzione.

Il design è la parte interessante. Una bibliografia indica uno spazio problematico, ma il salto creativo dalla letteratura esistente a una nuova ipotesi è esattamente ciò che l’articolo stesso fornisce, quindi quel salto è l’unica via per una risposta corretta. Per impedire ai modelli di ricordare semplicemente l’articolo, gli autori hanno costruito tre difese: nessun riferimento citato può essere successivo all’orizzonte di conoscenza dell’articolo, i nomi degli autori e i metadati identificativi vengono rimossi dai riferimenti e ogni bibliografia è congelata in modo che nulla trapeli al momento del test. Un modello indipendente funge da giudice, confrontando le ipotesi proposte con quelle reali.

Ciò che rende significativi i punteggi bassi è quanto strettamente si raggruppano. Se il compito venisse risolto ragionando, ci si aspetterebbe che modelli più forti andassero avanti. Invece i migliori hanno raggiunto a malapena il 15% e il resto si è raggruppato al di sotto, il che esclude spiegazioni su suggerimenti o dimensioni del modello e punta a qualcosa di strutturale. Un percorso ha funzionato meglio: una pipeline multi-agente che raccoglie ipotesi da diversi modelli, le fa criticare a vicenda, quindi elimina i candidati più deboli attraverso un torneo a staffe che ha raggiunto dal 23 al 42%, circa 2,4 volte il miglior modello singolo. Non è stata coinvolta alcuna ricerca esterna, quindi il miglioramento è venuto esclusivamente dalla diversità e dalle argomentazioni. Gli autori sottolineano che si tratta di un approssimativo sostituto computazionale della peer review, il che non è una coincidenza: è lo stesso meccanismo di correzione degli errori utilizzato dagli scienziati.

Alcuni avvertimenti appartengono qui. Questa è una prestampa che non è stata sottoposta a revisione paritaria. L’approccio del torneo richiede molte chiamate modello e infrastrutture di coordinamento e il documento non descrive in dettaglio il costo di calcolo. E il 42%, anche se molto meglio, lascia ancora la maggior parte delle idee non recuperate.

Che cosa significa questo per te: esiste ora un vasto settore che vende modelli linguistici come motori di generazione di ipotesi, e molte di queste affermazioni si basano su test in cui il modello potrebbe vedere il testo completo dell’articolo, i nomi degli autori o i segnali post-pubblicazione. I punteggi ottenuti in queste condizioni non dicono molto sul passaggio inferenziale. Se si sta valutando uno strumento scientifico basato sull’intelligenza artificiale, la domanda da porsi è se la valutazione fosse resistente alla contaminazione, ovvero se la risposta avrebbe potuto essere recuperata anziché ragionata. Per tutti gli altri, questo è un utile pezzo di zavorra contro l’umore attuale. Lo stesso mese ha portato risultati concreti sulle dimostrazioni matematiche e sulla progettazione delle proteine, e questi risultati non sono stati sminuiti. Ma riassumere brillantemente la letteratura e inventare l’idea successiva sono compiti diversi, e i modelli attuali sono visibilmente molto migliori all’inizio.

Fonti

Fonti: https://arxiv.org/abs/2608.16645

Articolo successivo

Secondo quanto riferito, Anthropic sta pagando 7 miliardi di dollari per un software che consente ai chip di andare oltre

Anthropic e Decart stanno scambiando le bozze avanzate di un'acquisizione da 7 miliardi di dollari, prevalentemente in azioni, con firma prevista per l'inizio di settembre. I modelli di sinistri Decart possono essere eseguiti fino a 8 volte più velocemente sullo stesso hardware.

Un ampio ventaglio di linee fluide si incanalava in un getto stretto e veloce che si alzava da un singolo chip del processore