Runway发布Solaris,界面由模型逐帧生成

Runway 放出了 Solaris,把它称作公司第一个”界面世界模型”。和那些帮人写前端代码的工具不同,Solaris 不产出代码,它直接产出画面:用户看到的每一帧界面都由模型现场生成,点击、拖拽这些动作被当成生成条件喂回模型,下一帧随之改变。

Runway 给出的运行指标有两条:交互延迟压在半秒以内,画质维持 720p。这两个数字决定了它现在能做什么、不能做什么。

点击被当成条件信号

Solaris 的结构是世界模型加语言模型。语言模型负责读懂用户的请求,并判断这次操作应该在当前场景里改动,还是切换到一个新场景;世界模型负责把判断结果画出来。整套流程按帧推进,模型自己从训练里学到”点这个位置会发生什么”,没有人给它写过按钮的回调函数。

这跟主流的 AI 生成界面路线分岔得很明显。过去两年大模型做 UI,套路是生成 HTML、React 代码,再交给浏览器渲染,界面的行为仍然由代码决定。Solaris 把渲染这一层整个吞掉了,屏幕上的图像本身就是应用。

61% 的偏好票

Runway 公布了一组自测结果:在界面重建任务上,Solaris 在结构相似度和信息保留两项指标上压过前沿大模型;另有一项 250 人参与的用户研究,在指令跟随的对比中,Solaris 有 61% 的比例被参与者优先选中。

这组数字全部来自 Runway 自己,第三方独立评测暂时一份也没有。61% 这个比例本身也不算悬殊,粗算下来,每 10 次对比里大约 6 次选它、4 次选对照组。对一个刚拿出来的研究原型,这个成绩说得过去,离”可以替代现有软件”还隔着很远。

720p 是个硬天花板

Runway 自己列的局限有四条:文字渲染不稳定、长会话里连贯性会掉、事实准确性不足以支撑商用、无障碍 API 还没接进去。

第一条和第四条最要命。文字渲染不稳,意味着表格、表单、代码编辑器这类信息密度高的界面暂时都不成立,一个数字画错,用户看不出来。无障碍 API 没接,屏幕阅读器就读不到任何东西——屏幕上根本没有 DOM 结构可供解析,只有像素。

720p 的分辨率上限同样划了一条线。手机应用、小游戏、演示型交互在这个分辨率下够用;桌面生产力软件、数据看板放到 720p 里,字号一压就糊。

从视频模型走到操作系统

Runway 这两年的重心一直在往世界模型挪,估值已经推到 53 亿美元一线,业务叙事从”AI 视频工具”改成了”模拟世界”。Solaris 是这条路线上第一个把靶子对准软件本身的产品——视频模型模拟的是物理世界,界面世界模型模拟的是人机交互这一层。

目前 Solaris 处在早期访问阶段,官网放了一个申请表单,Runway 说会先和几家关键伙伴一起把它推向公开。对国内团队来说,这个方向的门槛在于交互数据:模型要学会”点这里会发生什么”,就得有大量真实的界面操作轨迹,而这类数据的积累周期比视频长得多。

参考来源:Runway 官方研究页面、CocoLoop、AlphaSignal;交互延迟、分辨率上限与 250 人用户研究的偏好比例已逐项核对。