World Labs presenta Atlas, su nuevo modelo multimodal 3D
World Labs presenta Atlas, un modelo multimodal diseñado para comprender texto, imágenes, vídeo y datos 3D en un contexto espacial compartido. Puede generar entornos 3D coherentes, controlar la cámara con precisión, reconstruir escenas y realizar simulaciones espacio-temporales.
El 1 de septiembre, hora local de Estados Unidos, World Labs, la empresa de IA fundada por la profesora de Stanford Fei-Fei Li, presentó oficialmente Atlas, su nueva generación de modelos del mundo. La compañía lo define como un «omni world model for spatial intelligence» (modelo universal del mundo para inteligencia espacial) y afirma que es «el primer modelo multimodal del mundo».
Atlas es un modelo totalmente multimodal preentrenado desde cero, diseñado para procesar de forma nativa texto, imágenes, vídeo y datos 3D. Utiliza una arquitectura de Transformer autorregresivo por difusión multimodal que integra todas las entradas en un contexto espacial compartido. A partir de este contexto, genera el contenido posterior manteniendo la coherencia 3D con la información observada anteriormente.
Cuatro capacidades principales
Las capacidades de Atlas abarcan tres grandes áreas: generación, reconstrucción y simulación del mundo. En concreto, se dividen en cuatro direcciones:
Generación con control de cámara: Atlas puede recibir una o varias imágenes de referencia y generar nuevas vistas desde cualquier posición y ángulo de cámara especificados por el usuario. El modelo incorpora la geometría precisa de la cámara como un tipo de entrada nativo, superando los métodos anteriores basados principalmente en instrucciones de texto y controles más aproximados.
En cuanto a las especificaciones de salida, Atlas puede generar vídeos de hasta 1 minuto de duración en resolución 1440p. En una de las demostraciones oficiales, el modelo parte de una fotografía de un robot y genera una vista de su parte trasera. También «deduce» que debería haber una zona de césped junto a la piscina, lo que sugiere que el modelo no se limita a interpolar píxeles, sino que utiliza conocimiento del mundo para comprender y completar la escena.
Reconstrucción espacial: Atlas puede reconstruir escenas del mundo real a partir de entre una y varias decenas de imágenes de entrada. Puede generar fotogramas desde nuevos puntos de vista y producir representaciones 3D explícitas, como nubes de puntos y Gaussian Splatting. World Labs afirma que supera a modelos SOTA especializados en tareas de reconstrucción 3D.
Simulación espacio-temporal: Atlas puede modelar el espacio y el tiempo a partir de vídeos. Esto permite volver a encuadrar una secuencia para generar resultados visuales de calidad cinematográfica y también facilita flujos de trabajo de «Real-to-Sim» en robótica.
Generación de imágenes: Atlas puede generar imágenes y panoramas de 360 grados a partir de texto. Es capaz de seguir instrucciones complejas, representar texto dentro de las imágenes y producir diferentes estilos visuales.
Tecnología: el contexto espacial es la principal innovación
El elemento central del diseño de Atlas es su mecanismo de «contexto espacial» (spatial context). De forma similar a cómo un modelo de lenguaje codifica las entradas como contexto antes de generar una respuesta, Atlas introduce una diferencia fundamental: cada imagen queda anclada en una posición concreta dentro de un espacio 3D y entra en el contexto junto con la pose de la cámara.
Según World Labs, este diseño permite que los creadores «se sienten en la silla del director, en lugar de tirar de la palanca de una máquina tragaperras». Los usuarios pueden colocar dos imágenes de referencia completamente diferentes en distintas posiciones 3D dentro del contexto espacial. Atlas puede entonces generar un mundo que conecte ambas de forma fluida, imaginando por sí mismo espacios intermedios como porches, pasillos y esquinas.
Atlas combina avances procedentes de dos líneas tecnológicas: los grandes modelos de lenguaje y los modelos de vídeo. Por un lado, puede aprovechar técnicas de optimización de inferencia propias de los LLM, como las cachés KV y el despliegue desacoplado. Por otro, incorpora algoritmos utilizados en generación de vídeo, como la destilación de difusión y la guía sin clasificador.
Disponibilidad y análisis editorial
World Labs afirma que algunos socios ya han obtenido acceso anticipado a Atlas y que el acceso temprano se ampliará durante las próximas semanas. Actualmente Atlas no es de código abierto y posteriormente impulsará Marble y otros productos de World Labs. La compañía todavía no ha anunciado una fecha para su disponibilidad general.
La verdadera innovación de Atlas no está simplemente en generar vídeos más largos o con mayor resolución, sino en convertir la geometría espacial en una entrada nativa del modelo. El control de cámara pasa así de depender de una «descripción mediante texto» a utilizar «parámetros precisos».
Esto tiene implicaciones prácticas para sectores que necesitan un control espacial preciso, como los efectos visuales cinematográficos, el desarrollo de videojuegos y la simulación robótica.
Para los usuarios convencionales, Atlas todavía se encuentra en una fase de acceso temprano y no está disponible para su uso directo. Los desarrolladores interesados en solicitar acceso deberán seguir los canales oficiales de World Labs para conocer las próximas convocatorias.