World Labs 發表了新模型 Atlas,官方將其定位為面向空間智能的「全模態」模型:文字、圖片、影片、三維資料都走同一套架構,輸入進去,輸出的可以是圖片、影片、點雲,也可以是三維高斯潑濺(Gaussian Splatting)。這家公司先前的公開動作大多集中在募資與 Marble 平台上,模型本體始終沒有這麼完整地亮相過。
Atlas 的技術形態是多模態自迴歸擴散 Transformer,擴散部分採用矯正流(rectified flow)。它把相機姿態做成原生的條件輸入,這是整個模型最硬核的一項設計。產生一段影片時,鏡頭要往哪裡走、走多快、用什麼焦段,都能在像素等級指定,不必靠提示詞寫「緩慢推近」然後祈禱模型聽得懂。
一個模型扛下四類工作
官方列出的能力共四組。第一組是相機可控生成,從文字或一張圖出發產生影片,鏡頭軌跡由使用者指定。第二組是稀疏重建,餵入 1 張到 100 多張照片,模型輸出對應場景的三維表示。第三組是時空模擬,把既有影片重新構圖、換機位,官方特別點名機器人的 Real-to-Sim 用途。第四組較為常規,是文字生成圖片與 360 度全景。
影片輸出上限是 1440p、1 分鐘。這個數字放在今天的影片模型裡並不算積極,專攻影片生成的產品在時長上早已走得更遠。Atlas 主打的重點也不在時長,官方給出的對比數據是相機跟隨任務:使用者對 Atlas 結果的偏好比例達 93%,對手是 FLUX。三維重建方面,官方稱勝過了專門做重建的 SOTA 模型,平均絕對相對誤差為 25.3。
一個通才模型在兩條專業賽道上都不落下風,這是 Atlas 想說的故事。它站不站得住腳,得看早期測試者釋出的第三方結果。
相機控制為什麼是分水嶺
過去兩年,影片生成模型的鏡頭運動基本上靠語意猜測。你打「環繞拍攝」,模型會輸出一段大致在旋轉的畫面,但轉幾度、圓心在哪、有沒有飄移,完全沒有保證。做影視預覽的人普遍的做法是產生十幾條再挑一條;做機器人模擬的人則乾脆不用,因為模擬需要可重現的相機外部參數,「看起來有在動」沒有價值。
把姿態變成條件輸入,等於把這件事從生成問題降級成控制問題。模型仍在編造畫面內容,但鏡頭這個維度已經脫離了隨機性。對下游最直接的影響是,產生結果可以和三維重建對齊:同一場景既能拿到影片,也能拿到點雲和高斯潑濺,兩者共用同一套座標系。World Labs 把這條路線稱為空間智能,李飛飛先前為此募得 10 億美元資金時,說法也是如此。
早期測試,以及 Marble 的下一版
Atlas 目前只對部分合作夥伴開放,採申請表制,沒有公開 API,也沒有定價。官方明確表示它將驅動 Marble 未來的版本,Marble 是 World Labs 已經上線的空間生成平台,目前跑的還是上一代技術架構。
這樣的節奏是有考量的。World Labs 自成立以來,產品動作一直偏慢,Marble 是第一個能實際上手的東西,Atlas 則直接跳過公開發表這一關。對一家估值和募資金額都推得很高的公司來說,先把模型交到少數做機器人與影視產業的夥伴手上,回報比開放一個人人可試的 demo 更實際:前者能回饋模擬精度夠不夠,後者多半只會產出一批社群媒體上的短影片。
粗略算一下 Atlas 的實際門檻。1 分鐘 1440p 影片,加上同場景的三維輸出,單次推論的運算成本很難靠消費級訂閱方案打平,定價欄位空著大概也有這層原因。模型形態這一步先收斂了,該怎麼賣還得再等等看。
參考來源:World Labs 官方部落格、CocoLoop;模型架構、影片時長與解析度、相機跟隨偏好比例、重建誤差數值均按官方公布口徑核實。