贝有科技
文章 / 研究/大众科普

WORLD LABS · ATLAS · 2026.09.01

AI 终于学会
转过头看世界。

Atlas 是李飞飞创办的 World Labs 发布的新一代多模态世界模型。它从头训练,能把文字、图片、视频、相机位置和 3D 深度放进同一个“空间记忆”,再用它生成、复原和模拟世界。

生成按指定镜头路线生成视频复原从少量照片重建空间模拟改变视角、时间与物体输出视频、点云与 3D 场景
EARLY ACCESS

目前仅向部分合作伙伴开放,不是人人可用的公开产品

文字图片视频3D→ 同一个空间记忆
ATLAS / 60 秒说明书先把基本问题说清楚
它是什么?能理解空间关系的“全能世界模型”

不是聊天机器人,也不只是视频生成器。它把多种输入统一到带位置和视角的 3D 空间上下文中。

它能做什么?生成、重建、模拟三件事合一

控制摄影机生成最长 1 分钟 1440p 视频;由照片复原新视角与 3D;把实拍变成机器人训练场。

它特别在哪?相机和 3D 是模型的“母语”

普通模型听“镜头向左”这句话;Atlas 直接接收相机的位置、角度和深度信息,空间控制更明确。

现在能用吗?还不能像普通产品一样注册即用

Atlas 处于合作伙伴早期访问阶段,将驱动未来版本的 Marble;当前公开 Marble 不是这次 Atlas 本身。

30 秒先听懂

以前,AI 在“猜下一张画”;
现在,它开始“搭一个世界”。

普通视频模型“下一帧大概长这样。”

像一位画师,一张接一张地画。画面能很漂亮,但镜头一绕,桌椅和墙的位置可能悄悄变了。

VS
Atlas 世界模型“桌子在这里,门在那边。”

像先用积木搭好房间,再拿摄像机进去拍。换角度时,它尽量守住同一套空间关系。

一张照片不是一张扁平的纸,而是一扇窗。Atlas 想做的,是推开窗,走进它背后的世界。

它的意义,不是“又会一种生成”

会说世界,和
知道世界在哪里,是两回事。

大语言模型读过“杯子在桌上”,能够把这句话解释得很好。但真正去拿杯子的机器人还要知道:杯子离桌边多远、杯口朝哪里、手从哪条路线伸过去不会撞到水壶。语言提供概念,空间智能提供位置、形状、视角和行动后果。

第一层会描述

“这是一个厨房,桌上有杯子。”

语言模型已经很擅长
第二层会看见

认出杯子、桌子、门和人的动作。

视觉模型正在快速进步
第三层会搭世界

知道它们在空间里的关系,并能从新角度继续观察。

Atlas 重点跨越的一层
第四层会预测和行动

推演“推一下、走过去、抓起来”之后会发生什么。

世界模型的长期目标
为什么这一层很值钱?因为内容一旦从“看完就结束的像素”,变成“可继续使用的空间”,同一个世界就能被反复拍摄、编辑、训练和交给其他软件。

对创作者不用每换一个镜头就重新抽卡,搭一次世界,可以拍许多条路线。

对企业用普通照片和视频建立空间底稿,数字孪生与仿真采集门槛可能下降。

对机器人先在成千上万个可变化的数字场景里犯错,再把更成熟的策略带回现实。

先看官方视频,再听我们拆解

Atlas 的价值,
用眼睛看最快。

以下均为 World Labs 官方发布视频,保留原始链接。点击播放时,视频从 World Labs 的内容服务器加载;如果网络环境无法播放,可点“打开官方原页”。

WORLD LABS OFFICIAL
机器人 Real-to-Sim

几段普通实拍被变成可修改的数字训练场:物体、位置、灯光和动作都能换。

打开官方原页 ↗
WORLD LABS OFFICIAL
机器人眼中的办公室

Atlas 不只搭空间,还生成机器人沿路线移动时,机身摄像头和深度传感器会看到什么。

打开官方原页 ↗

实验一 / 给它几张照片?

看得越少,
它就越需要想象。

只给一张客厅照片,沙发背后完全看不见。Atlas 会根据常识补出一个“说得通”的答案。再给几张侧面照,它就少猜一点;给得足够多,它才更像在认真复原。

请记住

合理,不等于真实。没拍到的门、窗和家具,是模型猜出来的,不能拿去做事故取证或精密测量。

照片背后的房间1 VIEW
SPATIAL CONTEXT大胆想象

拖拽旋转 · 滚轮缩放

移动镜头
查看模型内部
官方依据官方称 Atlas 可从 1 张到 100 多张图片重建场景;两三张时已经能工作,但输入越多,模型需要想象的部分越少。

实验二 / 把两张不相干的图放进同一张地图

左边是森林,右边是客厅,
中间的路谁来修?

Atlas 的“空间上下文”不是把图片简单贴在一起。你可以告诉它:这张图在左边,那张图在右边,相隔多远。模型会尝试在中间补出门洞、走廊、院子或转角,让两个画面变成一个可以连续穿行的世界。

这很像给建筑师两张效果图和一张空白平面图:两头已经确定,中间怎么连接,由他利用经验补全。结果可以有创意,但不是唯一正确答案。

SPATIAL CONTEXT BUILDER2 ANCHORS / 50M
拖拽查看模型如何在两张图之间“修路”
你提供的左图Atlas 补出的过渡空间你提供的右图
官方依据官方演示将两张不相关参考图放到指定 3D 位置,Atlas 会想象门、走廊、角落等过渡结构,把它们连成一个世界。

实验三 / 把“镜头向左”换成坐标

它不是听导演喊口号,
而是直接拿到了摄影机轨道。

多数视频模型听到“镜头绕人物半圈”,只能猜这句话是什么意思。Atlas 把相机位置和角度当成一种原生输入,就像摄影师面前铺好了精确轨道:从哪里出发、升多高、朝哪里看,都能明确告诉它。

CAM
世界
起点转弯升高终点
这意味着什么?你是在“安排镜头”,不是在老虎机前反复抽卡。

官方展示可由 1–6 张参考图和人工设计的镜头路径,生成最长 1 分钟、1440p 的视频。

官方依据官方表述为 pixel-perfect camera control。这里的“精确”主要指相机几何控制,不代表画面里的每个物体都绝对不出错。

它到底能干什么?

同一个“大脑”,
换三份工作。

输入:参考图+镜头路线

让镜头穿过一个保持连贯的世界

适合电影预演、广告、游戏过场和视觉特效。它的优势不是单张图更漂亮,而是导演能更具体地决定“怎么拍”。

输出:最长 1 分钟的 1440p 视频

名字很吓人,拆开都是熟人

“多模态自回归扩散 Transformer”
其实是四个人一起搭积木。

多模态什么线索都收

文字、图片、相机位置、3D 深度都能放进同一本空间笔记。

自回归一块接一块搭

像写下一句话,也像铺下一块积木;后面的生成会参考前面已经搭好的内容。

扩散从雾里擦出画面

先是一团噪点,再一点点去掉“雪花”,让图像和深度逐渐清楚。

Transformer负责统筹全场

它让远近不同的线索互相对照,并能借用大语言模型已有的加速技术。

四个词合起来:Atlas 把各种空间线索排成一条队伍,一项一项往后生成;遇到图片和 3D,就用“从模糊到清楚”的方式画出来。

别把四种东西混在一起

Atlas 不是 ChatGPT,
也不只是一个视频生成器。

它像什么最擅长什么缺的那一块
大语言模型在文字世界里理解、推理和回答知道“椅子在桌旁”,不等于有精确空间地图
普通图像 / 视频模型生成漂亮画面和连续片段镜头复杂运动时,物体位置和几何可能漂移
传统 3D 扫描与建模结果可控、可测量、能进入专业工作流通常需要更多设备、照片、人工清理和制作时间
Atlas在同一模型中生成、复原和模拟空间脑补不是真相,物理精度与生产稳定性仍待实测
Marble目前可用的 World Labs 世界生成产品Atlas 是下一代底座,将驱动未来 Marble,不是当前已替换完成

真正的大故事:空间生产成本可能被重新计算

过去要“造一个数字世界”,
现在可能先拍几段视频。

传统流程里,拍摄、3D 扫描、建模、贴图、动画、仿真常常是几套工具、几批人。Atlas 的野心是让同一个基础模型在这些环节之间来回切换:既能从现实重建,也能从想象生成;既给人看视频,也给机器输出深度和 3D。

以前设备+棚+人+时间

多机位摄影棚 / 激光扫描 / 3D 美术 / 手工布光 / 仿真工程

可能的新入口普通相机+世界模型

少量照片或视频 → 空间底稿 → 镜头、3D、模拟等多种输出

影视与广告小团队也能预演大镜头

先确定场景和机位,再反复设计运动路径;补拍、转场与子弹时间的成本有机会下降。

游戏与文旅把照片变成可探索空间

老建筑、景区、展览和故事场景,可以更快做出数字原型,再交给专业工具继续加工。

电商与空间设计同一商品放进许多场景

不只换背景,而是保持空间关系,围绕商品重新走镜头、改陈列和观察视角。

数字孪生让“采集现实”更轻

仓库、门店、办公室的空间底稿可能不再完全依赖昂贵扫描设备,但精确测量仍需专业工具。

机器人训练数据不必全部实拍

一段现实录像可以衍生不同物体、灯光和路线,制造现实里稀缺或危险的训练情况。

AI 智能体从电脑桌面走向物理空间

未来的智能体不仅要点按钮,还要理解房间、设备和人的位置,先预测行动后果再动手。

所以 Atlas 的意义是什么?它在尝试把“空间”变成像文字和代码一样,可由 AI 生成、读取、修改、传递和执行的通用媒介。

别急着喊“物理世界 AGI”

它迈过了一道门槛,
但还没走到终点。

已经很厉害空间控制进入模型底层

相机不是一句模糊提示词,而是带位置和角度的正式输入;2D 画面与 3D 深度也能由同一个模型处理。

仍要验证“看起来对”不等于“物理上对”

官方展示了刚体、关节物体和软物体的模拟流程,但这不等于它已掌握所有摩擦、重量、液体和破坏规律。

数据要冷静看基准结果来自官方发布

官方称在相机控制和稀疏视图 3D 重建上胜过所比较的专用模型;更广泛结论还需独立测试与真实项目验证。

今天还买不到Atlas 正在早期访问

它将驱动未来版本的 Marble 和 World Labs 其他产品。现在能公开使用的 Marble,与刚发布的 Atlas 不是同一个产品版本。

人物彩蛋 / 为什么又是李飞飞?

她先让 AI 认清猫和狗,
现在又想让 AI
走进那张照片。

很多年前,计算机视觉有个尴尬:算法再聪明,也没有足够多、足够整齐的图片可学。李飞飞推动创建了 ImageNet——可以把它想成一本超级厚的“看图识物练习册”。后来深度学习在这本练习册上大显身手,现代计算机视觉由此加速。

但她显然不满足于让机器回答“这是一只猫”。人看见猫,会同时知道它趴在沙发上、离桌边有多远、下一秒可能跳到哪里。于是问题从“这是什么?”变成了“它在哪里?这个世界会怎样变化?我能怎么行动?”

2000s给 AI 一本看图练习册

ImageNet 用大规模标注图像推动视觉识别,让机器先学会叫出万物的名字。

2010s–2020s把 AI 拉回“以人为本”

在斯坦福长期研究视觉与智能,并共同领导以人为本人工智能研究,强调技术最终服务于人。

2024 →创办 World Labs

把研究重心推向空间智能:让 AI 不只理解互联网里的词和图,还能生成、推理并模拟三维世界。

2026发布 Atlas

同一个模型接收文字、图片、视频、相机和 3D,让“看见、搭建、模拟”第一次更紧密地合在一起。

如果说 ImageNet 教 AI 给世界万物贴上名字,Atlas 想做的,就是把这些万物从卡片上拿下来,重新摆回一个有前后左右、能够变化的世界。