World Labs 发布 Atlas:把相机坐标当输入的多模态世界模型,3 台手机能复刻子弹时间
World Labs(李飞飞的公司)发布新模型 Atlas。名字来自希腊神话中背负天球的泰坦,官方定位是“世界上第一个多模态世界模型”。
这个定位直接把 Atlas 和视频生成模型分开。World Labs 的判断是,单纯视频生成模型和世界模型之间差得挺远;Atlas 要理解的是三维场景,不是把二维画面做得更流畅。
镜头控制从长提示词变成坐标输入
以前让 AI 镜头动起来,需要写“镜头缓慢上摇”“向左平移”“绕到人物背后”这类指令。用文字描述镜头,效率低,结果也不可控。
Atlas 把相机当成一个正式输入。用户需要什么视角,给场景坐标就能控制生成内容。官方对这种交互变化的说法是:Atlas 是在布置场景,不是在拉老虎机的拉杆——从赌运气变成当导演。
关键设计:空间上下文
这套能力的基础是名为“空间上下文”的机制。
普通视频模型看一张输入图,会把它当作平面照片,去猜测周围会出现什么内容。Atlas 的做法是先给图像一个三维位置:画面在哪儿、朝向哪儿、距离多远。积累足够多带空间信息的图之后,模型内部会形成一个持续的三维场景,后续内容基于这个场景生成。
同样是在做预测,视频模型预测的是下一帧像素,Atlas 预测的是世界的三维构成。
相机控制与 3D 重建的对比结果
在相机控制上,Atlas 和几个主流视频生成模型做了对比并投票,结果如下:
- 对比 MiniMax H3,75% 的人选择 Atlas;
- 对比 Seedance,94% 的人选择 Atlas。
镜头越难,Atlas 的胜率越高。
3D 重建方面,Atlas 的误差为 25.3,全场最低。同场比较的重建模型都专做 3D 重建,Atlas 的误差仍低于它们。
从视频生成赛道往上走一层
过去两年,视频生成赛道集中在画质和时长上较劲。Atlas 的做法是往上走一层:视频仍然能生成,但它只是模型对空间完成一次推理后渲染出来的画面;模型本身在搭建的是一套能理解世界的系统。
两个已经展示的应用场景
子弹时间:从 120 台相机降到 3 台手机
《黑客帝国》里的子弹时间场景,当年剧组架了 120 台相机。现在用 Atlas,只需要 3 台手机拍摄现场,就能把冻结的一瞬间从任意角度重新生成一遍。
机器人虚拟训练场:24 帧视频替代几十万扫描设备
机器人虚拟训练场过去需要几十万元级别的扫描设备。现在用手机拍摄 24 帧视频,Atlas 就能还原出一个可运行的仿真世界。受影响最直接的会是房地产、游戏、影视和机器人行业。
视频生成模型让机器输出画面,世界模型让机器理解空间。李飞飞从教机器认图走到让机器认空间,Atlas 是这条路径上的最新一步。它能走多远,目前还很难判断。
对 Atlas 感兴趣的可以先提交官方申请,产品可用时会通过邮件通知: