El equipo de Fei-Fei Li presenta Atlas, video controlable en 1440p de un minuto

World Labs ha publicado su nuevo modelo Atlas, presentado oficialmente como un modelo "omni" orientado a la inteligencia espacial: texto, imagen, video y datos 3D pasan por la misma arquitectura, tanto de entrada como de salida, y esta última puede ser una imagen, un video, una nube de puntos o un Gaussian Splatting 3D. Las acciones públicas previas de la empresa se habían centrado en rondas de financiación y en la plataforma Marble; el modelo en sí nunca se había mostrado por completo.

A nivel técnico, Atlas es un Transformer de difusión autorregresivo multimodal, cuya parte de difusión usa rectified flow. La decisión de diseño más determinante de todo el modelo es convertir la pose de la cámara en una entrada condicional nativa. Al generar un video, la dirección del movimiento de cámara, la velocidad y la distancia focal pueden especificarse a nivel de píxel, sin necesidad de escribir en el prompt algo como "acercar lentamente" y confiar en que el modelo lo entienda.

Un modelo para cuatro tipos de tareas

Según la empresa, las capacidades se agrupan en cuatro bloques. El primero es la generación con cámara controlable: a partir de un texto o una imagen se genera un video cuya trayectoria de cámara define el usuario. El segundo es la reconstrucción dispersa: con 1 a más de 100 fotos como entrada, el modelo produce la representación 3D correspondiente de la escena. El tercero es la simulación espaciotemporal: recomponer videos existentes o cambiar el ángulo de cámara; World Labs menciona explícitamente su uso en Real-to-Sim para robótica. El cuarto es más convencional: texto a imagen y panorámicas de 360 grados.

El límite de salida de video es 1440p y un minuto de duración. Esta cifra no resulta especialmente ambiciosa frente a los modelos de video actuales, ya que los productos especializados en video llegan mucho más lejos en duración. El argumento de Atlas tampoco apunta a la duración, sino a los datos comparativos en tareas de seguimiento de cámara: la tasa de preferencia de los usuarios por los resultados de Atlas fue del 93%, frente a FLUX. En reconstrucción 3D, la empresa afirma que el modelo supera a los modelos SOTA especializados, con un error relativo absoluto medio de 25,3.

Un modelo generalista que no queda por detrás en dos disciplinas especializadas: esa es la historia que Atlas quiere contar. Si se sostiene o no dependerá de los resultados de terceros que publiquen los primeros probadores.

Por qué el control de cámara marca la diferencia

En los últimos dos años, el movimiento de cámara en los modelos de generación de video dependía básicamente de adivinar según el significado. Se escribe "toma circular" y el modelo entrega un fragmento que gira más o menos, pero cuántos grados, alrededor de qué centro, con o sin desvíos, no hay ninguna garantía. Quienes hacen previsualización para cine y televisión suelen resolverlo generando una decena de versiones y eligiendo una; quienes hacen simulación de robótica directamente no lo usan, porque la simulación necesita parámetros extrínsecos de cámara reproducibles, y "parece que se mueve" no tiene ningún valor.

Convertir la pose en entrada condicional equivale a rebajar el problema de generación a un problema de control. El modelo sigue "inventando" el contenido de la imagen, pero la dimensión de la cámara deja de ser aleatoria. El efecto más directo para las aplicaciones posteriores es que el resultado de la generación puede alinearse con la reconstrucción 3D: la misma escena produce tanto video como nube de puntos y Gaussian Splatting, compartiendo el mismo sistema de coordenadas. World Labs llama a esta línea inteligencia espacial, el mismo término que usó Fei-Fei Li cuando la empresa obtuvo antes una ronda de 1.000 millones de dólares.

Pruebas tempranas, y la próxima versión de Marble

Por ahora, Atlas solo está disponible para algunos socios seleccionados, mediante un formulario de solicitud, sin API pública ni precio definido. La empresa deja claro que Atlas impulsará futuras versiones de Marble, la plataforma de generación espacial de World Labs ya en funcionamiento, que actualmente sigue corriendo sobre la pila tecnológica de la generación anterior.

Este ritmo no es casual. Desde su fundación, los movimientos de producto de World Labs siempre han sido bastante lentos; Marble fue lo primero realmente accesible para el público, mientras que Atlas se salta por completo el lanzamiento público. Para una empresa con una valoración y una financiación tan elevadas, entregar primero el modelo a un grupo reducido de socios de robótica e industria audiovisual resulta más rentable que abrir una demo para que cualquiera la pruebe: el primer grupo puede dar retroalimentación sobre si la precisión de la simulación es suficiente, mientras que el segundo probablemente solo generaría una oleada de videos cortos para redes sociales.

Haciendo un cálculo aproximado del umbral real de Atlas: un minuto de video en 1440p, más la salida 3D de la misma escena, hace que el costo computacional de una sola inferencia difícilmente pueda cubrirse con una suscripción de consumo, lo que probablemente también explica por qué el campo del precio sigue en blanco. La forma del modelo ya ha convergido; cómo se venderá todavía tendrá que esperar.

Fuentes: blog oficial de World Labs, CocoLoop; la arquitectura del modelo, la duración y resolución del video, la tasa de preferencia en el seguimiento de cámara y los valores de error de reconstrucción se verificaron conforme a los datos publicados oficialmente.