CourionAI
ES
Boletín
← Todas las noticias
world-models 3 min de lectura

World Labs muestra Atlas, un modelo que construye escenas 3D transitables a partir de un puñado de fotos

La compañía de Fei-Fei Li presentó un modelo que genera, reconstruye y simula espacio 3D en lugar de video plano. Genera nubes de puntos, ejecuta un minuto de metraje de 1440p y puede producir datos de entrenamiento para robots.

Una fotografía plana en posición vertical y que se despliega en una habitación construida a partir de miles de puntos flotantes con una trayectoria de cámara en bucle dibujada a través de ella.

World Labs, la compañía cofundada por Fei-Fei Li, anunció la semana pasada un modelo llamado Atlas que hace algo que la mayoría de las herramientas de imagen y video de IA no pueden: entender dónde están las cosas en el espacio. Aliméntelo con dos o tres fotografías de una habitación y podrá mostrarle esa habitación desde ángulos que nadie fotografió, generarlos como datos 3D reales y dejar que un robot simulado la atraviese.

La diferencia técnica es pequeña para describir y grande en efecto. Los modelos de vídeo tratan una escena como una secuencia de fotogramas planos. Atlas ancla cada entrada, ya sea texto, imagen, video o datos 3D, primero en una posición en el espacio tridimensional. World Labs llama a esto “contexto espacial”. Significa que el movimiento de la cámara se transmite como geometría, un camino real que usted dibuja, en lugar de ser descrito en un mensaje esperado.

Los números concretos: Atlas produce hasta un minuto de vídeo a 1440p. Reconstruye escenas a partir de tan solo una imagen y maneja más de cien. En una demostración, ensambla el patio principal de Stanford a partir de 25 fotografías a nivel del suelo y luego genera vistas aéreas desde muy arriba. Puede exportar nubes de puntos y símbolos gaussianos, que son formas de almacenar una escena con tantos puntos pequeños en el espacio para que pueda verse sin problemas desde cualquier dirección. En pruebas comparativas realizadas por evaluadores humanos, los revisores prefirieron Atlas a MiniMax H3 en el 75 por ciento de las comparaciones y a Seedance 2,5 en el 94 por ciento.

¿Qué hay detrás de esto?

Li ha estado argumentando durante algún tiempo que la “inteligencia espacial” es la pieza que falta. Los modelos de lenguaje aplanan el mundo en una línea de fichas, los modelos de video en una pila de cuadros, y luego ambos luchan con preguntas que un niño pequeño encuentra fáciles, como qué hay detrás de esa silla. Atlas es el intento de construir directamente la capa que falta.

El uso comercialmente más interesante no son las imágenes bonitas. Son robots. Atlas puede reconstruir una habitación real y luego generar lo que las cámaras y los sensores de profundidad de un robot verían a lo largo de cualquier camino a través de ella, con objetos, iluminación y fondos intercambiados. Esto convierte una grabación real en miles de situaciones de entrenamiento, lo que constituye actualmente el costoso cuello de botella de la robótica.

Vale la pena mantener las expectativas firmes: World Labs Atlas está en acceso temprano para socios seleccionados, no existe un punto de referencia público que capture lo que hace y la mayoría de las comparaciones provienen del propio World Labs.

Qué significa esto para ti: Nada hoy, a menos que trabajes en robótica, arquitectura, juegos o cine. Pero es un buen indicador de hacia dónde se dirige el campo. Los últimos tres años se centraron en modelos que leen y escriben. El siguiente tramo se trata de modelos que saben dónde están las cosas, que es lo que cualquier máquina debe entender antes de poder moverse con seguridad por su cocina.

Fuentes

Fuentes: https://the-decoder.com/world-labs-unveils-atlas-a-single-ai-model-that-generates-reconstructs-and-simulates-3d-worlds-from-just-a-few-photos/

Siguiente artículo

Anthropic ha contratado hasta 517 mil millones de dólares en potencia informática en once meses

Un análisis de The Information sitúa los compromisos informáticos de Anthropic desde octubre en 14,8 gigavatios y hasta 517.000 millones de dólares durante la próxima década, frente a los aproximadamente 180.000 millones de dólares que había dicho a los inversores que esperaban.

Una hilera de torres de alta tensión con bastidores de servidores apilados colgando entre ellos donde estarían los cables.