CourionAI
IT
Newsletter
← Tutte le notizie
world-models 3 min di lettura

Un robot che segue solo gli oggetti e prevede il movimento sbagliato. Qualcuno ha finalmente misurato in base a quanto

L'aggiunta di credenze, intenzioni e norme sociali a un modello mondiale ha aumentato la previsione dell'azione da 63,3 a 87,9 F1. GPT-4.1 con il framework batte GPT-5.6 Sol senza di esso.

Un robot con un fumetto contenente piccole figure umane e frecce di previsione

Ecco una scena. Qualcuno mette la tazza nell’armadietto mentre sei fuori dalla stanza. Torni indietro. Dove guardi? A tavola, ovviamente, perché è lì che l’hai lasciato. Un sistema che traccia solo gli oggetti sbaglia ogni volta, perché fisicamente la tazza è nell’armadietto e questo è tutto ciò che vede.

Un articolo pubblicato il 22 agosto trasforma quell’esperimento mentale in una misurazione. Gli autori sostengono che i modelli del mondo odierni, ovvero i sistemi che prevedono come cambia una scena quando qualcuno agisce, modellano solo lo strato fisico: oggetti, posizioni, movimento, cosa si nasconde dietro cosa. Sora, Genie 3, JEPA e Marble vengono tutti raggruppati nella stessa famiglia e criticati per la stessa omissione. Ciò che le persone sulla scena credono, vogliono o considerano socialmente appropriato non entra mai nello Stato.

La loro struttura, Mental World Modeling, aggiunge queste variabili: credenze, attenzione, obiettivi, intenzioni, emozioni, norme e relazioni. Ogni azione viene divisa in un vettore fisico e un carico utile mentale. Far scorrere una tazza su un tavolo è lo stesso gesto, sia che si tratti di scuse, di inganno o di atto di cura, e solo lo strato mentale li distingue. Gli autori stanno attenti a dire che non stanno simulando la coscienza. Gli stati mentali qui sono ipotesi dedotte dal comportamento e i sistemi dovrebbero mantenere visibile tale incertezza.

I numeri

Per testarlo hanno costruito MENTIS, una pipeline che non necessita di formazione aggiuntiva, e Menti-Bench, una serie di 448 scene decisionali composte da 320 descrizioni testuali, 100 storie illustrate e 28 clip audio e video. Ogni scena offre sei opzioni di risposta più una risposta di riferimento umano.

In otto modelli, rispondendo direttamente ha ottenuto 63,3 su F1, una misura di precisione standard. Facendo la stessa domanda sei volte e prendendo la risposta più comune siamo arrivati ​​a 77,9. L’intera pipeline ha raggiunto 87,9. Gli esseri umani hanno raggiunto 98,5 con lo stesso protocollo.

Il risultato più sorprendente è che non è possibile acquistarlo con un calcolo aggiuntivo. Il modello più debole che esegue il framework, GPT-4.1 a 84,9, ha battuto il modello più forte che rispondeva direttamente con campionamento ripetuto, GPT-5.6 Sol a 83,6. La struttura batte la capacità grezza. Togliendo il canale mentale i modelli perdono in media 12,1 punti; rimuovi il canale fisico e perdono 16,5. Entrambi sono necessari e prevederli insieme anziché separatamente vale un altro 6.4.

I guadagni arrivano dove la teoria dice che dovrebbero: 26,4 punti nelle scene tra persone, solo 14,0 in quelle incentrate sugli oggetti. Circa l’80% del divario rimanente rispetto all’uomo deriva da un passo, simulando il successivo cambiamento dello stato fisico e mentale accoppiato.

Che cosa significa per te: Niente che tu possa utilizzare oggi. Ma questo spiega una frustrazione che potresti già riconoscere, quando un assistente fa esattamente quello che hai letteralmente chiesto e non capisce completamente cosa intendevi. Questo divario non è un problema di cortesia, è un problema di modellizzazione, e questo articolo è uno dei primi a mettervi un numero. Per chiunque stia seguendo la direzione in cui si sta dirigendo l’intelligenza artificiale dopo i chatbot, i modelli mondiali rappresentano la grande scommessa e il settore non ha ancora raggiunto un accordo su una definizione.

Fonti

Fonti: https://github.com/mental-world/Mentis

Articolo successivo

Anthropic ha assunto l'uomo che ha costruito i chip IA di Google, e il motivo non è sottile

Amir Salek ha distribuito sette generazioni di TPU di Google. Ora si unisce al team informatico di Anthropic, mentre Broadcom accumula più di 60 miliardi di dollari di debito per la capacità dei chip.

Un chip del circuito attraversato da una chiave inglese con due mani geometriche che si incontrano sopra di essa