🎯 科技 · AI

🔥 "AI教母"李飞飞发布全球首个多模态世界模型Atlas,一张照片重建3D世界,1分钟1440p视频自由运镜

北京时间9月2日,AI科学界传来重磅消息:李飞飞创办的World Labs正式发布新一代世界模型Atlas,号称"全球首个多模态世界模型"。这个模型能从几张照片里重建整个三维空间,还能生成最长达1分钟、1440p分辨率的视频——关键是,它能听懂"镜头向左拉升"这种专业指令,精准控制运镜角度。

过去AI视频生成的核心痛点是"抽奖":你输入一段描述,模型随机生成,能不能满意全凭运气。Atlas的做法是,把相机在三维空间中的位置和姿态直接变成模型的原生输入。这意味着什么?给1到6张照片,定好运镜轨迹,就能生成最长1分钟、1440p的大片,画面空间几何丝滑一致。导演系同学可以狂喜了,几个场景素材就能还原一整个空间,不用再几百个机位实拍。

一、从ImageNet到世界模型:李飞飞的十年布局

提起李飞飞,最为人熟知的标签是"ImageNet之母"。2009年,她创建了ImageNet图像识别数据集,推动了计算机视觉算法的突破,也为后来的深度学习革命奠定了基础。2024年,她创办World Labs,两年间公司完成三轮融资,最新一轮达10亿美元,投资者包括AMD、英伟达、富达投资等顶级机构。

李飞飞在公开采访中多次强调一个判断:语言模型让机器学会了处理"文字",下一步必须让AI真正理解"空间"。空间智能最直接的应用是机器人技术,此外还会赋能游戏、特效制作、虚拟制片、室内设计等领域。清华大学智能产业研究院助理教授赵昊评价:"从呈现的效果看,Atlas的泛化性很强,对于行业具有突破性意义。"

二、技术拆解:Spatial Context是什么黑科技?

Atlas的核心创新在于"空间上下文"(Spatial Context)机制。大语言模型靠上文接下文理解文本,Atlas则是给每张图片绑定三维坐标和深度,在模型"脑子里"搭出一个带轴网的房间。

具体来说,输入一张只拍到机器人正面的照片,模型能把背影完完整整"脑补"出来;给一张泳池边角照,它能靠世界常识默默补全没拍到的草坪和远山。更有趣的是,随便抓两张八竿子打不着的照片往空间里一扔,Atlas都能脑补出走廊、大门和房间,把两个场景无缝连接。

不过,官方也坦承了当前局限:视角跨度越大、生成路径越长,局部几何漂移、物体形状变化和纹理闪烁也越容易暴露。它生成的更像是一个视觉上合理的三维世界,未必就是原来那个世界的精确数字复刻。但这已经比市面上大部分视频生成模型进了至少一大步。

三、对机器人行业的真正价值

对创意工作者来说,Atlas是效率工具;但对机器人行业而言,Atlas的意义在于解决了"仿真环境搭建"的痛点。传统方式需要采集大量环境图像、使用昂贵专业设备,而Atlas仅依靠少量简易录制素材,就能辅助搭建仿真环境,同时还原物体的运动方式与交互行为。

World Labs披露,Atlas已能根据输入图像重建3D空间,输出显式三维结果,并对输入视频进行时空建模重绘。这些能力一旦成熟,将直接降低机器人训练的仿真成本,加速具身智能的商业化落地。

综合中国证券报、爱范儿、DeepTech深科技报道 | 2026年9月3日