World Labs 把新模型 Atlas 放了出来,官方给它的定位是面向空间智能的”全模态”模型:文本、图像、视频、三维数据走同一套架构,输入进去,出来的可以是图片、视频、点云,也可以是三维高斯泼溅。这家公司此前的公开动作集中在融资和 Marble 平台上,模型本体一直没有完整露面。
Atlas 的技术形态是多模态自回归扩散 Transformer,扩散部分用矫正流(rectified flow)。它把相机位姿做成了原生的条件输入,这是整个模型最硬的一处设计。生成一段视频时,镜头往哪儿走、走多快、什么焦段,都能在像素级别指定,用不着靠提示词写”缓慢推近”然后祈祷模型听懂。
一个模型吃下四类活
官方列出的能力有四组。第一组是相机可控生成,从文本或一张图出发生成视频,镜头轨迹由用户给定。第二组是稀疏重建,喂进 1 张到 100 多张照片,模型输出对应场景的三维表示。第三组是时空模拟,把已有视频重新构图、换机位,官方点名了机器人的 Real-to-Sim 用途。第四组比较常规,文生图和 360 度全景。
视频输出上限是 1440p、1 分钟。这个数字放在今天的视频模型里不算激进,专攻视频的产品在时长上已经走得更远。Atlas 的口径也不在时长上,它给出的对比数据是相机跟随任务:用户对 Atlas 结果的偏好率 93%,对手是 FLUX。三维重建方面,官方称它压过了专门做重建的 SOTA 模型,平均绝对相对误差 25.3。
一个通才模型在两个专用赛道上都不落下风,这是 Atlas 想讲的故事。它站不站得住,要看早期测试者放出的第三方结果。
相机控制为什么是分界线
过去两年,视频生成模型的镜头运动基本靠语义猜。你写”环绕拍摄”,模型输出一段大致在转的画面,但转多少度、圆心在哪儿、有没有漂移,全无保证。做影视预演的人对此的普遍处理是生成十几条挑一条;做机器人仿真的人则干脆不用,仿真需要可复现的相机外参,“看起来在动”没有价值。
把位姿变成条件输入,等于把这件事从生成问题降级成了控制问题。模型仍然在编造画面内容,镜头这一维退出了随机性。对下游最直接的影响是生成结果可以和三维重建对齐:同一场景既能拿到视频,也能拿到点云和高斯泼溅,两者共享同一套坐标。World Labs 把这条路径叫空间智能,李飞飞此前为此拿到 10 亿美元融资时给的说法也是这个。
早期测试,以及 Marble 的下一版
Atlas 眼下只对部分合作伙伴开放,走申请表制,没有公开 API,也没有定价。官方明确说了它将驱动 Marble 未来的版本,Marble 是 World Labs 已经上线的空间生成平台,现在跑的还是上一代技术栈。
这个节奏有讲究。World Labs 成立以来的产品动作一直偏慢,Marble 是第一个能上手的东西,Atlas 则直接跳过了公开发布这一环。对一家估值和融资额都推得很高的公司来说,先把模型交到少数几个做机器人和影视工业的伙伴手上,回报比开一个人人可试的 demo 更实在:前者能反馈出仿真精度够不够,后者大概率只会产出一批社交媒体上的短视频。
粗算一下 Atlas 的实际门槛。1 分钟 1440p 视频,加上同场景的三维输出,单次推理的算力开销很难被消费级订阅覆盖,定价一栏空着大概也有这个原因。模型形态这一步先收敛了,怎么卖还得再等一等。
参考来源:World Labs 官方博客、CocoLoop;模型架构、视频时长与分辨率、相机跟随偏好比例、重建误差数值均按官方公布口径核对。