CourionAI
FR
Newsletter
← Toutes les actus
world-models 3 min de lecture

World Labs présente Atlas, un modèle qui crée des scènes 3D praticables à partir d'une poignée de photos

La société de Fei-Fei Li a dévoilé un modèle qui génère, reconstruit et simule un espace 3D plutôt qu'une vidéo plate. Il produit des nuages ​​de points, exécute une minute de séquence 1440p et peut produire des données d'entraînement pour les robots.

Une photographie plate, debout et dépliée dans une pièce construite à partir de milliers de points flottants, traversée par un chemin de caméra en boucle.

World Labs, la société cofondée par Fei-Fei Li, a annoncé la semaine dernière un modèle appelé Atlas qui fait quelque chose que la plupart des outils d’image et de vidéo d’IA ne peuvent pas faire : comprendre où se trouvent les objets dans l’espace. Donnez-lui deux ou trois photos d’une pièce et il pourra vous montrer cette pièce sous des angles que personne n’a photographiés, la produire sous forme de données 3D réelles et laisser un robot simulé la parcourir.

La différence technique est petite à décrire et importante dans ses effets. Les modèles vidéo traitent une scène comme une séquence d’images plates. Atlas ancre d’abord chaque entrée, qu’il s’agisse de texte, d’image, de vidéo ou de données 3D, à une position dans un espace tridimensionnel. World Labs appelle cela le « contexte spatial ». Cela signifie que le mouvement de la caméra est transmis sous forme de géométrie, un chemin réel que vous dessinez, plutôt que décrit dans une invite et espéré.

Les chiffres concrets : Atlas produit jusqu’à une minute de vidéo en 1440p. Il reconstruit des scènes à partir d’une seule image et en gère plus d’une centaine. Dans une démo, il assemble le Main Quad de Stanford à partir de 25 photos au niveau du sol, puis génère des vues aériennes de loin au-dessus. Il peut exporter des nuages ​​de points et des éclaboussures gaussiennes, qui sont des moyens de stocker une scène autant de petits points dans l’espace afin qu’elle puisse être visualisée en douceur depuis n’importe quelle direction. Lors de tests comparatifs jugés par des évaluateurs humains, les évaluateurs ont préféré Atlas au MiniMax H3 dans 75 pour cent des comparaisons et à Seedance 2,5 dans 94 pour cent.

Qu’est-ce qu’il y a derrière ça

Li soutient depuis un certain temps que « l’intelligence spatiale » est la pièce manquante. Les modèles linguistiques aplatissent le monde en une ligne de jetons, les modèles vidéo en une pile d’images, et les deux se débattent ensuite avec des questions qu’un tout-petit trouve faciles, comme ce qu’il y a derrière cette chaise. Atlas est la tentative de construire directement la couche manquante.

L’utilisation la plus intéressante commercialement n’est pas celle des belles images. Ce sont des robots. Atlas peut reconstruire une pièce réelle, puis générer ce que les caméras et les capteurs de profondeur d’un robot verraient le long de n’importe quel chemin qui la traverse, avec des objets, un éclairage et des arrière-plans inversés. Cela transforme un véritable enregistrement en milliers de situations de formation, ce qui constitue actuellement le goulot d’étranglement coûteux de la robotique.

Il vaut la peine de maintenir les attentes fondées : World Labs Atlas est en accès anticipé pour les partenaires sélectionnés, il n’existe aucune référence publique qui reflète ce qu’il fait, et la plupart des comparaisons proviennent de World Labs lui-même.

Ce que cela signifie pour vous : Rien aujourd’hui, sauf si vous travaillez dans le domaine de la robotique, de l’architecture, des jeux ou du cinéma. Mais c’est un bon indicateur de la direction que prend le terrain. Les trois dernières années ont été consacrées aux modèles qui savent lire et écrire. La prochaine étape concerne les modèles qui savent où se trouvent les choses, ce que toute machine doit comprendre avant de pouvoir se déplacer en toute sécurité dans votre cuisine.

Sources

Sources: https://the-decoder.com/world-labs-unveils-atlas-a-single-ai-model-that-generates-reconstructs-and-simulates-3d-worlds-from-just-a-few-photos/

Article suivant

Anthropic a signé jusqu'à 517 milliards de dollars de puissance de calcul en onze mois

Une analyse de The Information estime les engagements informatiques d'Anthropic depuis octobre à 14,8 gigawatts et à 517 milliards de dollars au cours de la prochaine décennie, contre environ 180 milliards de dollars attendus par les investisseurs.

Une rangée de pylônes électriques en retrait avec des racks de serveurs empilés suspendus entre eux là où se trouveraient les câbles