🎯 AI · 科技前沿

🔥 从"生成画面"到"生成世界",李飞飞用Atlas重新定义AI的空间智能

一、一张照片重建完整空间

当地时间2026年9月1日,"AI教母"李飞飞创办的World Labs正式发布新一代世界模型Atlas。官方将其定义为"全球首个多模态世界模型",能够原生处理文本、图像、视频、相机位姿与3D深度信息,在同一套模型中完成世界生成、空间重建和时空模拟。

过去,视频生成模型的相机控制全靠"文字玄学"——输入"镜头缓慢向左拉升",结果全凭运气。Atlas的做法是把相机位姿参数作为底层原生输入,直接给坐标、定轨迹。只需1到6张普通照片,就能生成最长1分钟、1440p分辨率的视频。官方演示中,输入一张机器人正面照片,Atlas能补全背面;给一张泳池边角照,它能脑补出草坪和远山。

二、"空间上下文"取代"文本上下文"

Atlas的核心创新在于"空间上下文"(Spatial Context)。架构上,它是一个多模态自回归扩散Transformer——类比大语言模型把输入编码成context再生成token,Atlas的流程相同,但每张图像都被锚定在三维空间的具体位置,带着相机位姿一起进入模型。

这意味着你可以往空间里放两张毫不相关的参考图,指定它们的相对位置,Atlas会生成两者之间平滑过渡的世界,自动想象出门廊、走道和转角。在斯坦福大学Main Quad的演示中,仅用2到25张游客视角的地面平拍照,就还原了草坪、拱廊和纪念教堂外墙的全部细节,并生成上帝视角航拍漫游。在DTU、ETH3D、ScanNet等公开数据集上,Atlas的稀疏视角重建误差(AbsRel ×10⁻³)达到25.3。

三、12亿美元赌"空间智能"终局

2024年9月,李飞飞以2.3亿美元启动资金创办World Labs,两年后 Atlas宣告问世。目前公司估值已达12亿美元,融资弹药充足。李飞飞在社交平台置顶称:"Atlas为从视觉特效到机器人的众多应用场景打开了大门。"其高徒、英伟达机器人主管Jim Fan评价:"这是机器人领域Real-to-Sim的一大步。"

从"生成好看的世界"转向"生成够用的世界",Atlas的真正野心是让AI真正理解3D世界的物理法则和几何结构——这不仅是技术跃迁,更是空间智能时代的入场券。世界模型的竞争,才刚刚开始。

综合封面新闻、i黑马报道 | 2026年9月4日