李飞飞团队发布 Atlas:World Model 到底在解决什么?
Atlas and the question of world models9 月 1 日,李飞飞创办的 World Labs 发布了新模型 Atlas。
官方把它称为一个面向 Spatial Intelligence 的 World Model(世界模型)。它可以同时处理文字、图片、视频和 3D 信息,用来生成、重建和模拟空间世界。
看到这条新闻后,我也去试了 World Labs 目前已经公开的 Marble。严格来说,我体验的不是刚发布的 Atlas;Atlas 还在 early access,未来会进入新版 Marble。
Marble 可以从一张照片生成一个能走进去探索的 3D 世界。第一次看到确实挺有意思,但真正进去走一圈,瑕疵也很明显:原图没拍到的地方需要模型自己补,有些物体换个角度就开始变形,空间关系和真实环境也不总是对得上。
所以这次体验没有让我觉得“世界马上要变了”。它更像让我具体理解了一个之前有些抽象的概念:
World Model 到底想解决什么,以及为什么李飞飞、Yann LeCun 这些研究者都长期关注这个方向。
LLM 已经知道很多关于世界的事,为什么还不够?
可以想象桌边放着一个玻璃杯。
今天的 LLM 当然知道,玻璃掉到地上可能会碎,杯子放得太靠边容易被碰掉,也知道如果要把杯子拿起来,可以抓住杯身或者把手。
这些都是关于世界的知识。但如果一个机器人真的站在这张桌子前,它还需要处理更具体的问题:杯子现在在哪里,离桌边还有多远,机械臂从这个角度伸过去会不会撞到旁边的东西;如果推一下杯子,它会往哪里移动;换到桌子的另一边,同一个杯子又应该出现在什么位置。
这里需要理解的已经不只是“杯子通常是什么样”,而是眼前这个世界现在是什么状态,以及接下来可能怎样变化。
World Model 大致就在处理这类问题。
可以把 World Model 理解成一种内部的世界模拟
World Model 目前并没有一个所有研究者完全统一的定义,但背后的想法很好理解。
人做很多动作之前,会先大致预测后果。看到杯子快掉下桌子,我们不需要真的等它摔碎,才知道最好伸手扶一下;过马路看到一辆车靠近,也会自然判断它的方向、速度和距离,再决定现在要不要继续走。
如果 AI 以后要在物理世界里行动,它也需要类似的能力:理解当前状态,预测接下来可能发生什么,并判断自己的行动会怎样改变世界。
所以 World Model 里有一个很核心的问题:
如果我这样做,会发生什么?
这也是它为什么经常被形容成某种 internal simulator。AI 可以在行动之前,先预测几个可能的未来,再选择比较合适的一条路。
Atlas 具体做了什么?
World Labs 对 World Model 的能力用了三个很清楚的词:Generate、Reconstruct、Simulate。
Generate
是从文字、图片等输入继续生成一个世界,包括原始输入里没有看到的空间。
Reconstruct
是用一张或多张真实照片还原现实中的 3D 场景。输入信息越多,模型需要自己猜的部分越少。
Simulate
则加入了时间和变化。Atlas 不只处理一个静止场景,也尝试理解世界怎样随时间变化,以及如何把真实环境转成可以用于机器人训练和测试的 simulation。
技术上,Atlas 把 text、image、camera pose 和 3D depth 等不同信息组织进同一个 spatial context。每张图片不只是一些 pixels,它还对应一个明确的 3D 观察位置和角度。模型根据已经看到的空间信息,再继续预测新的视角、画面和 3D 结构。
对我来说,理解到这里已经够了。至于 multimodal autoregressive diffusion transformer 具体怎样实现,可以等真的需要研究模型架构时再往下钻。
它和 Sora 这样的 Video Model 有什么区别?
这两个概念确实很容易混在一起,因为一个好的视频生成模型,本身也必须学到大量世界规律。
如果让模型生成一个球从桌上滚落的视频,它至少需要让运动看起来符合常识。随着视频模型越来越强,它们和 World Model 之间的边界也会越来越模糊。
但两者关注的问题还是有一些区别。
视频生成首先需要解决的是:接下来的画面应该长什么样。
World Model 会更关心这个世界本身是否保持一致。刚才的桌子换一个观察角度以后还在不在?一个物体被挡住以后是否仍然存在?从房间另一边看回来,几个物体之间的空间关系有没有发生奇怪的变化?如果一个 agent 采取了动作,整个世界状态接下来会怎样改变?
所以生成一段视觉上合理的视频,和维持一个可以持续观察、预测和操作的世界,并不是完全相同的问题。
我自己试 Marble 时,最容易看到的也是这层差距。一张照片可以很快长成一个漂亮的 3D 场景,但只要开始从不同方向探索,就会发现“看起来合理”和“真正理解这个空间”之间还有不少距离。
Yann LeCun 这些年其实也一直在押 World Model
理解 Atlas 时,我想到的另一个人是 Yann LeCun 杨立昆。
他这些年一直认为,如果 AI 最终要理解物理世界、进行 planning 和采取行动,只依赖语言是不够的。Meta 后来推出的 V-JEPA 2 就直接被称为 World Model,它通过大量视频学习世界中的运动和变化,再加入少量机器人行动数据,让模型预测某个 action 发生以后,世界可能怎样变化。
所以李飞飞和 LeCun 确实在关注一个很接近的大方向:
AI 需要形成某种关于物理世界如何运转的内部模型。
两边的技术路线不一样。
LeCun 的 JEPA 很强调,不需要预测现实里的每一个 pixel。比如我要判断一辆车是不是正在向我靠近,并不需要同时预测下一秒每片树叶的位置、路人衣服上的褶皱和云的形状。真正影响行动的可能只是:车正在靠近、速度大概是多少、距离还剩多少。
所以 JEPA 主要在抽象的 representation 里进行预测。
World Labs 的 Atlas 更偏生成式。它会直接生成 image、video、depth 和 3D 世界,并利用这些不同形式共同建立 spatial context。
我觉得目前没有必要判断哪一条路线“更正确”。它们都在尝试回答一个仍然很开放的问题:
什么样的内部表示,才能让 AI 真正理解一个会变化、可以行动的世界?
为什么讲到 World Model,最后经常又会讲机器人?
还是回到桌上的杯子。
假设任务是让机器人把杯子放进水槽。它要先看到周围环境,知道杯子、桌子和自己分别在哪里,然后考虑从什么方向靠近、怎样抓住杯子、移动时会不会碰到其他物体。
World Model 更接近帮助它预测:这样做以后会发生什么。
另外还有一个最近经常出现的概念叫 VLA(Vision-Language-Action)。它把视觉输入、语言目标和机器人动作连起来,更接近解决:为了完成这个目标,我现在应该采取什么动作。
真实系统当然不会永远这么干净地分成两块,而且现在的 VLA 也不一定都需要一个独立的 World Model。但把它们这样区分,对理解技术地图很有帮助:
World Model 帮助预测世界;Policy / VLA 帮助选择行动;机器人把动作真正执行出来,再根据新的观察继续调整。
于是 AI 在物理世界里的工作会逐渐形成一个循环:观察环境、预测结果、采取行动,再观察新的结果。
这也是为什么 World Model、Spatial Intelligence、Embodied AI、VLA 和 Robotics 最近经常会一起出现。它们不是同一个概念,只是在逐渐拼起“AI 怎样在现实世界里行动”这件事的不同部分。
那 Atlas 这次发布,意义到底有多大?
我觉得现在还很难下一个特别大的结论。
Atlas 刚刚发布,目前只对少量合作伙伴开放。普通用户能直接体验的仍然是 Marble,而我刚才的使用感受也很明确:它已经能完成一些以前很难想象的事情,但离准确、稳定地理解和模拟真实空间,还有明显距离。
所以如果问它今天会不会改变大多数人的日常生活,我觉得暂时不会。
但从技术发展的角度看,这条路线值得继续留意。
过去几年,生成式 AI 最明显的进步首先发生在语言,后来逐渐扩展到图片、声音和视频;Agent 又让 AI 开始从生成内容走向使用工具和完成任务。World Model 关注的是另一组问题:AI 能不能建立一个持续存在的空间,理解物体之间的关系和时间变化,并预测自己的行动会产生什么后果。
这些能力如果逐渐成熟,应用范围会很广。游戏和影视可以更容易创建完整的可探索空间,建筑和设计可以把现实环境转成 simulation,AR / VR 可以更容易获得 3D 世界,机器人则可以先在大量模拟环境中学习和测试,再进入现实。
其中一些已经能看到早期应用,另一些还很远。
Atlas 现在更像这个发展过程里的一个节点。它没有把 World Model 这个问题解决掉,但把生成、空间重建、时间模拟和机器人 simulation 放进了一个更统一的模型框架里。
自己试过以后,我对 World Model 的理解具体了一些
如果只看官方 demo,很容易把注意力放在生成效果够不够惊艳。
自己拿一张熟悉的空间照片去试,会开始观察另外一些东西:原图没有拍到的位置,模型是怎么补的?换一个角度以后,原来的物体还能不能保持一致?空间比例有没有慢慢跑掉?如果再增加几张同一个地方的照片,结果会不会更接近真实环境?
这些问题都指向同一个区别:
生成一个看起来合理的世界,和建立一个足够可靠的世界模型,还有很长的距离。
这大概也是我现在觉得 Atlas 值得关注、但不需要过度兴奋的原因。
它代表的方向很好理解:如果 AI 未来不只处理文字、图片和网页,也真的要进入我们的物理世界,它需要逐渐学习空间、时间、物体、变化,以及行动产生的后果。
现在这件事还做得不够好。
但 World Model 这条路在试图去哪里,已经越来越清楚了。
Btw, Atlas 最常见的英文意思是“地图集”。
这个词来自希腊神话里的 Atlas,他是一个被罚肩负天空的 Titan。World Labs 没有公开解释模型为什么取这个名字,所以不必给它附会一个官方寓意。
不过,一个用来生成、重建和模拟 worlds 的模型叫 Atlas,确实挺贴切。