CourionAI
IT
Newsletter
← Tutte le notizie
world-models 3 min di lettura

World Labs mostra Atlas, un modello che costruisce scene 3D percorribili da una manciata di foto

La società di Fei-Fei Li ha presentato un modello che genera, ricostruisce e simula lo spazio 3D anziché il video piatto. Produce nuvole di punti, esegue un minuto di filmati a 1440p e può produrre dati di addestramento per i robot.

Una fotografia piatta che sta in piedi e si apre in una stanza composta da migliaia di punti fluttuanti con un percorso circolare della fotocamera tracciato attraverso di essa

World Labs, la società co-fondata da Fei-Fei Li, ha annunciato la scorsa settimana un modello chiamato Atlas che fa qualcosa che la maggior parte degli strumenti di intelligenza artificiale per immagini e video non possono fare: capisce dove si trovano le cose nello spazio. Dategli due o tre foto di una stanza e potrà mostrarvi quella stanza da angolazioni che nessuno ha fotografato, trasmetterle come dati 3D reali e lasciare che un robot simulato la attraversi.

La differenza tecnica è piccola da descrivere ma grande negli effetti. I modelli video trattano una scena come una sequenza di fotogrammi piatti. Atlas ancora ogni input, sia esso testo, immagine, video o dati 3D, prima a una posizione nello spazio tridimensionale. World Labs chiama questo “contesto spaziale”. Significa che il movimento della telecamera viene trasmesso come geometria, un percorso effettivo che disegni, piuttosto che descritto in modo rapido e sperato.

I numeri concreti: Atlas produce fino a un minuto di video a 1440p. Ricostruisce scene da una sola immagine e ne gestisce più di cento. In una demo assembla il quad principale di Stanford da 25 foto a livello del suolo e quindi genera viste aeree dall’alto. Può esportare nuvole di punti e simboli gaussiani, che sono modi per memorizzare una scena come tanti piccoli punti nello spazio in modo che possa essere visualizzata senza problemi da qualsiasi direzione. Nei test testa a testa giudicati da valutatori umani, i revisori hanno preferito Atlas a MiniMax H3 nel 75% dei confronti e a Seedance 2.5 nel 94%.

Cosa c’è dietro tutto questo?

Li sostiene da tempo che “l’intelligenza spaziale” è il pezzo mancante. I modelli linguistici appiattiscono il mondo in una linea di token, i modelli video in una pila di fotogrammi, ed entrambi poi lottano con domande che un bambino trova facile, come cosa c’è dietro quella sedia. Atlas è il tentativo di costruire direttamente lo strato mancante.

L’uso più interessante dal punto di vista commerciale non sono le belle immagini. Sono i robot. Atlas può ricostruire una stanza reale e quindi generare ciò che le telecamere e i sensori di profondità di un robot vedrebbero lungo qualsiasi percorso che la attraversa, con oggetti, illuminazione e sfondi scambiati. Ciò trasforma una registrazione reale in migliaia di situazioni di addestramento, che oggi rappresentano il costoso collo di bottiglia della robotica.

Vale la pena mantenere le aspettative con i piedi per terra: World Labs Atlas è in accesso anticipato per partner selezionati, non esiste un benchmark pubblico che catturi ciò che fa e la maggior parte dei confronti proviene dallo stesso World Labs.

Che cosa significa per te: Niente oggi, a meno che tu non lavori nel campo della robotica, dell’architettura, dei giochi o del cinema. Ma è un buon indicatore della direzione in cui si sta dirigendo il campo. Gli ultimi tre anni hanno riguardato modelli che leggono e scrivono. Il prossimo passo riguarda i modelli che sanno dove sono le cose, che è ciò che ogni macchina deve capire prima di potersi muovere in sicurezza nella tua cucina.

Fonti

Fonti: https://the-decoder.com/world-labs-unveils-atlas-a-single-ai-model-that-generates-reconstructs-and-simulates-3d-worlds-from-just-a-few-photos/

Articolo successivo

Anthropic ha firmato fino a 517 miliardi di dollari di potenza di calcolo in undici mesi

Un'analisi di The Information stima gli impegni informatici di Anthropic da ottobre a 14,8 gigawatt e fino a 517 miliardi di dollari nel prossimo decennio, rispetto ai circa 180 miliardi di dollari che gli investitori avevano detto di aspettarsi.

Una fila sfuggente di tralicci elettrici con rack di server impilati sospesi tra loro dove dovrebbero essere i cavi