CourionAI
DE
Newsletter
← Alle News
world-models 3 Min. Lesezeit

World Labs zeigt Atlas, ein Modell, das aus einer Handvoll Fotos begehbare 3D-Szenen erstellt

Das Unternehmen von Fei-Fei Li stellte ein Modell vor, das 3D-Raum anstelle von flachem Video generiert, rekonstruiert und simuliert. Es gibt Punktwolken aus, zeigt eine Minute 1440p-Filmmaterial an und kann Trainingsdaten für Roboter erstellen.

Ein flaches Foto, das aufrecht steht und sich in einen Raum entfaltet, der aus Tausenden schwebender Punkte besteht und durch den ein Kamerapfad in einer Schleife gezogen ist

World Labs, das von Fei-Fei Li mitbegründete Unternehmen, kündigte letzte Woche ein Modell namens Atlas an, das etwas kann, was die meisten KI-Bild- und Videotools nicht können: Es versteht, wo sich Dinge im Weltraum befinden. Füttere es mit zwei oder drei Fotos eines Raums und es kann dir diesen Raum aus Winkeln zeigen, die niemand fotografiert hat, es als tatsächliche 3D-Daten ausgeben und einen simulierten Roboter durch ihn laufen lassen.

Der technische Unterschied ist klein in der Beschreibung und groß in der Wirkung. Videomodelle behandeln eine Szene als eine Folge flacher Bilder. Atlas verankert jede Eingabe, ob Text, Bild, Video oder 3D-Daten, zunächst an einer Position im dreidimensionalen Raum. World Labs nennt dies „räumlichen Kontext“. Dies bedeutet, dass die Kamerabewegung als Geometrie übergeben wird, ein tatsächlicher Pfad, den Sie zeichnen, und nicht in einer Eingabeaufforderung beschrieben und erhofft wird.

Die konkreten Zahlen: Atlas gibt bis zu einer Minute Video mit 1440p aus. Es rekonstruiert Szenen aus nur einem Bild und verarbeitet mehr als hundert. In einer Demo setzt es Stanfords Main Quad aus 25 Bodenfotos zusammen und generiert dann Luftaufnahmen von weit oben. Es können Punktwolken und Gaußsche Splats exportiert werden. Dabei handelt es sich um Möglichkeiten, eine Szene mit möglichst vielen kleinen Punkten im Raum zu speichern, sodass sie aus jeder Richtung reibungslos betrachtet werden kann. In direkten Vergleichstests, die von menschlichen Gutachtern beurteilt wurden, bevorzugten die Rezensenten Atlas in 75 Prozent der Vergleiche gegenüber MiniMax H3 und in 94 Prozent der Vergleiche gegenüber Seedance 2.5.

Was steckt dahinter

Li argumentiert seit einiger Zeit, dass „räumliche Intelligenz“ das fehlende Stück sei. Sprachmodelle verflachen die Welt zu einer Reihe von Zeichen, Videomodelle zu einem Stapel von Bildern, und beide kämpfen dann mit Fragen, die einem Kleinkind leicht fallen, wie zum Beispiel, was sich hinter diesem Stuhl befindet. Atlas ist der Versuch, die fehlende Ebene direkt aufzubauen.

Die kommerziell interessanteste Verwendung sind nicht schöne Bilder. Es sind Roboter. Atlas kann einen realen Raum rekonstruieren und dann generieren, was die Kameras und Tiefensensoren eines Roboters auf jedem Weg durch ihn sehen würden, wobei Objekte, Beleuchtung und Hintergründe ausgetauscht werden. Dadurch werden aus einer echten Aufzeichnung Tausende von Trainingssituationen, was derzeit den teuren Engpass in der Robotik darstellt.

Es lohnt sich, die Erwartungen auf dem Boden zu halten: Der World Labs Atlas ist für ausgewählte Partner im frühen Zugriff, es gibt keinen öffentlichen Benchmark, der seine Leistung erfasst, und die meisten Vergleiche stammen von World Labs selbst.

Was das für Sie bedeutet: Nichts heute, es sei denn, Sie arbeiten in den Bereichen Robotik, Architektur, Spiele oder Film. Aber es ist ein guter Indikator dafür, wohin sich das Feld entwickelt. In den letzten drei Jahren ging es um Models, die lesen und schreiben können. Im nächsten Abschnitt geht es um Modelle, die wissen, wo sich Dinge befinden. Das ist es, was jede Maschine verstehen muss, bevor sie sich sicher durch Ihre Küche bewegen kann.

Quellen

Quellen: https://the-decoder.com/world-labs-unveils-atlas-a-single-ai-model-that-generates-reconstructs-and-simulates-3d-worlds-from-just-a-few-photos/

Nächster Artikel

Anthropic hat sich in elf Monaten Rechenleistung im Wert von bis zu 517 Milliarden US-Dollar gesichert

Einer Analyse von The Information zufolge beliefen sich die Rechenleistungszusagen von Anthropic seit Oktober auf 14,8 Gigawatt und im nächsten Jahrzehnt auf bis zu 517 Milliarden US-Dollar, verglichen mit den etwa 180 Milliarden US-Dollar, mit denen das Unternehmen den Anlegern gerechnet hatte.

Eine zurückweichende Reihe von Strommasten mit dazwischen hängenden gestapelten Serverschränken, wo die Kabel verlaufen würden