🎯 科技 · AI

🔥 从"生成画面"到"生成世界",李飞飞用Atlas重新定义AI对三维空间的理解

一、一张照片生成三维世界

9月2日,"AI教母"李飞飞创办的World Labs正式发布全球首个多模态世界模型Atlas。这款模型不再满足于生成图片、文字,而是可以将二维图像重建为完整的三维世界,实现生成、重建与模拟的统一。

Atlas最直观的突破在于相机控制的革命性升级。过去,用户在视频生成模型的提示框里输入"镜头缓慢向左拉升、绕着人物微仰角旋转",结果全凭运气。Atlas的做法是把"相机位姿参数"当作底层原生输入,只需输入1到6张普通照片,定好运镜轨迹,就能生成最长1分钟、1440p分辨率的视频。从"文字玄学"到"像素级精确",这是视频生成领域的一次质的飞跃。

二、"空间上下文"取代"文本上下文"

Atlas的核心创新在于"空间上下文"(Spatial Context)设计。类比大语言模型:LLM把输入编码成context再生成后续token,Atlas流程相同,区别在于每一张图像都被锚定在三维空间中的具体位置,带着相机位姿一起进入模型。

这意味着你可以往空间上下文里放两张毫不相关的参考图,并指定它们在三维空间中的相对位置,Atlas会生成一个在两者之间平滑过渡的世界,自己想象出门廊、走道和转角。在斯坦福大学Main Quad的演示中,仅用2到25张游客视角的地面平拍照,就还原了草坪、拱廊和纪念教堂外墙的全部细节,并生成了上帝视角航拍漫游。

三、12亿美元押注"空间智能"终局

2024年9月,李飞飞以2.3亿美元启动资金创办World Labs,两年后Atlas的发布标志着"从生成好看的世界转向生成够用的世界"。这款模型被World Labs划分为四类能力:相机控制生成、空间重建、时空模拟和图像生成。

其高徒、英伟达机器人主管Jim Fan评价:"这是机器人领域Real-to-Sim的一大步。"李飞飞本人则将Atlas视为World Labs的"里程碑式"成果,称其为"从视觉特效到机器人的众多应用场景打开了大门"。12亿美元的投入,押注的是AI对三维世界的终极理解。

当AI开始真正理解空间、时间和物理法则,我们离"数字孪生"走进现实又近了一大步。

综合封面新闻、i黑马报道 | 2026年9月4日