🎯 AI · 世界模型

🔥 AI从"生成画面"迈入"生成世界",李飞飞用Atlas重新定义空间智能

北京时间9月2日,"AI教母"李飞飞创办的World Labs正式发布新一代世界模型Atlas。官方称其为"全球首个多模态世界模型",能够原生处理文本、图像、视频、相机位姿与3D深度信息,并在同一套模型中完成世界生成、空间重建和时空模拟。过去用户写提示词描述镜头运动全凭运气,Atlas直接把相机位姿参数当作底层原生输入,你要什么角度、什么轨迹,直接给坐标就行。输入1到6张普通照片,定好运镜轨迹,就能生成最长1分钟、1440p分辨率的视频。

在斯坦福大学Main Quad的演示中,Atlas仅用2到25张游客视角的地面平拍照,就还原了草坪、拱廊和纪念教堂外墙的全部细节,并生成了上帝视角航拍漫游。在DTU、ETH3D等公开数据集上,Atlas的稀疏视角重建误差(AbsRel ×10⁻³)达到了25.3,刷新了行业基准。

一、一张照片重建世界,相机控制不再靠"玄学"

北京时间9月2日,"AI教母"李飞飞创办的World Labs正式发布新一代世界模型Atlas。官方称其为"全球首个多模态世界模型",能够原生处理文本、图像、视频、相机位姿与3D深度信息,并在同一套模型中完成世界生成、空间重建和时空模拟。过去用户写提示词描述镜头运动全凭运气,Atlas直接把相机位姿参数当作底层原生输入,你要什么角度、什么轨迹,直接给坐标就行。输入1到6张普通照片,定好运镜轨迹,就能生成最长1分钟、1440p分辨率的视频。

在斯坦福大学Main Quad的演示中,Atlas仅用2到25张游客视角的地面平拍照,就还原了草坪、拱廊和纪念教堂外墙的全部细节,并生成了上帝视角航拍漫游。在DTU、ETH3D等公开数据集上,Atlas的稀疏视角重建误差(AbsRel ×10⁻³)达到了25.3,刷新了行业基准。

二、"空间上下文":给每张照片一个三维坐标

Atlas的核心设计叫"空间上下文"。架构上,它是一个多模态自回归扩散Transformer。类比大语言模型:LLM把输入编码成context再生成后续token,Atlas流程相同,区别在于进入context的每一张图像都被锚定在三维空间中的一个具体位置,它带着相机位姿一起进来。这意味着你可以往空间上下文里放两张毫不相关的参考图,并指定它们在三维空间中的相对位置,Atlas会生成一个在两者之间平滑过渡的世界,自己想象出门廊、走道和转角。

清华大学智能产业研究院助理教授赵昊评价:"Atlas的泛化性很强,对于行业具有突破性意义。"李飞飞的高徒、英伟达机器人主管Jim Fan评论:"这是机器人领域Real-to-Sim的一大步。"

三、从创意制作到机器人训练,应用场景全面打开

World Labs将Atlas的能力划分为四类:相机控制生成、空间重建、时空模拟和图像生成。对影视工作者来说,用几张照片就可以还原一个空间场景,大幅开拓创作空间;对机器人训练而言,传统方式需要专业设备采集环境图像,而Atlas仅依靠少量简易录制素材,就可以辅助搭建仿真环境,同时还原物体的运动方式与交互行为。

World Labs成立于2024年9月,启动资金2.3亿美元,两年后已获得10亿美元融资,投资者包括AMD、英伟达、富达投资等。李飞飞将Atlas视作公司的"里程碑式"成果,认为它为从视觉特效到机器人的众多应用场景打开了大门。AI大模型正从大语言模型、视频生成模型向世界模型发展,空间智能正在成为AGI的关键一环。

综合中国证券报、封面新闻、21世纪经济报道报道 | 2026-09-03