Nhóm của Fei-Fei Li ra mắt Atlas, video 1440p có thể điều khiển dài 1 phút

World Labs vừa công bố mô hình mới Atlas, được định vị chính thức là mô hình "đa năng toàn diện" (omni-modal) hướng tới trí tuệ không gian: văn bản, hình ảnh, video và dữ liệu 3D đi qua cùng một kiến trúc, đầu vào có thể là bất kỳ dạng nào trong số đó, còn đầu ra có thể là ảnh, video, đám mây điểm (point cloud), hoặc Gaussian Splatting 3D. Trước đó, các động thái công khai của công ty này chủ yếu xoay quanh việc gọi vốn và nền tảng Marble, còn bản thân mô hình thì chưa từng lộ diện đầy đủ.

Về mặt kỹ thuật, Atlas là một Transformer khuếch tán tự hồi quy đa phương thức (multimodal autoregressive diffusion Transformer), phần khuếch tán sử dụng rectified flow. Điểm thiết kế cứng nhất của toàn bộ mô hình là việc đưa tư thế camera thành đầu vào điều kiện gốc. Khi tạo một đoạn video, hướng di chuyển của ống kính, tốc độ di chuyển, tiêu cự sử dụng đều có thể chỉ định ở cấp độ pixel, không cần viết prompt kiểu "lia máy chậm" rồi cầu mong mô hình hiểu đúng ý.

Một mô hình đảm nhận bốn loại việc

Theo công bố chính thức, năng lực của Atlas chia thành bốn nhóm. Nhóm một là tạo sinh có kiểm soát camera: xuất phát từ văn bản hoặc một bức ảnh để tạo video, quỹ đạo ống kính do người dùng chỉ định. Nhóm hai là tái dựng thưa (sparse reconstruction): đưa vào từ 1 đến hơn 100 bức ảnh, mô hình xuất ra biểu diễn 3D tương ứng của cảnh. Nhóm ba là mô phỏng không-thời gian: bố cục lại video có sẵn, đổi góc camera, phía World Labs đặc biệt nhắc tới ứng dụng Real-to-Sim cho robot. Nhóm bốn tương đối thông thường: tạo ảnh từ văn bản và ảnh toàn cảnh 360 độ.

Giới hạn đầu ra video là 1440p, dài 1 phút. Con số này so với các mô hình video hiện nay không phải là đột phá, các sản phẩm chuyên về video đã đi xa hơn nhiều về độ dài. Trọng tâm mà Atlas muốn nhấn mạnh cũng không nằm ở độ dài, mà là dữ liệu so sánh cho tác vụ bám theo camera: tỷ lệ người dùng ưu tiên chọn kết quả của Atlas là 93%, đối thủ so sánh là FLUX. Về tái dựng 3D, phía công ty cho biết mô hình vượt qua các mô hình SOTA chuyên về tái dựng, với sai số tương đối tuyệt đối trung bình là 25,3.

Một mô hình đa năng không thua kém trên cả hai đường đua chuyên dụng — đó là câu chuyện Atlas muốn kể. Nó có đứng vững hay không còn phải chờ kết quả từ bên thứ ba do những người thử nghiệm sớm công bố.

Vì sao điều khiển camera là ranh giới phân định

Trong hai năm qua, chuyển động ống kính của các mô hình tạo video về cơ bản dựa vào việc "đoán" theo ngữ nghĩa. Bạn viết "quay vòng quanh", mô hình cho ra một đoạn hình đại khái đang xoay, nhưng xoay bao nhiêu độ, tâm xoay ở đâu, có bị trôi hay không thì hoàn toàn không có gì đảm bảo. Cách xử lý phổ biến của dân làm previs điện ảnh là tạo ra hơn chục bản rồi chọn một; còn dân làm mô phỏng robot thì thẳng thừng không dùng, vì mô phỏng cần thông số ngoại camera có thể tái lập được, "trông như đang chuyển động" là vô giá trị.

Biến tư thế camera thành đầu vào điều kiện, tương đương với việc hạ cấp bài toán này từ một bài toán tạo sinh xuống thành một bài toán điều khiển. Mô hình vẫn đang "bịa" ra nội dung hình ảnh, nhưng chiều không gian của ống kính đã thoát khỏi tính ngẫu nhiên. Tác động trực tiếp nhất đối với các ứng dụng phía sau là kết quả tạo sinh có thể căn chỉnh (align) với tái dựng 3D: cùng một cảnh vừa có thể lấy được video, vừa có thể lấy được đám mây điểm và Gaussian Splatting, cả hai dùng chung một hệ tọa độ. World Labs gọi hướng đi này là trí tuệ không gian, và đây cũng chính là cách nói mà Fei-Fei Li từng dùng khi công ty gọi được khoản vốn 1 tỷ USD trước đó.

Thử nghiệm sớm, và phiên bản tiếp theo của Marble

Hiện tại Atlas chỉ mở cho một số đối tác nhất định, theo hình thức đăng ký qua biểu mẫu, chưa có API công khai, cũng chưa công bố giá. Phía công ty nói rõ rằng Atlas sẽ là động lực cho các phiên bản tương lai của Marble — nền tảng tạo sinh không gian đã ra mắt của World Labs, hiện vẫn đang chạy trên ngăn xếp công nghệ thế hệ trước.

Nhịp độ này có chủ đích. Kể từ khi thành lập, các động thái sản phẩm của World Labs luôn khá chậm, Marble là thứ đầu tiên người dùng thực sự có thể trải nghiệm, còn Atlas thì bỏ qua hẳn bước ra mắt công khai. Với một công ty có định giá và số vốn gọi được đều rất cao, việc trước tiên trao mô hình cho một số ít đối tác làm robot và công nghiệp điện ảnh mang lại lợi ích thực tế hơn so với việc mở một bản demo cho tất cả mọi người dùng thử: nhóm đối tác đầu có thể phản hồi xem độ chính xác mô phỏng đã đủ hay chưa, còn nhóm sau nhiều khả năng chỉ tạo ra một loạt video ngắn trên mạng xã hội.

Thử ước tính sơ bộ ngưỡng chi phí thực tế của Atlas. Một phút video 1440p, cộng thêm đầu ra 3D của cùng cảnh đó, chi phí tính toán cho một lần suy luận rất khó được một gói thuê bao cấp tiêu dùng gánh nổi, đây có lẽ cũng là lý do mục giá vẫn còn để trống. Bước hình thái mô hình đã hội tụ trước, còn cách bán ra sao thì vẫn phải chờ thêm.

Nguồn tham khảo: Blog chính thức của World Labs, CocoLoop; kiến trúc mô hình, thời lượng và độ phân giải video, tỷ lệ ưu tiên bám camera, số liệu sai số tái dựng đều được đối chiếu theo công bố chính thức.