🎯 科技 · AI

全球首个多模态世界模型Atlas发布,1张照片重建3D世界,空间智能迈入新纪元

一、AI空间智能的"ImageNet时刻"

9月2日,李飞飞创办的空间智能公司World Labs正式发布全球首个多模态世界模型Atlas。这不是又一个视频生成模型,而是一个从零预训练的"空间操作系统"——文本、图像、视频、相机位姿和3D深度信息,全部纳入同一套模型架构。一句话概括:Atlas让AI真正"看懂"了空间,而不只是生成好看的画面。

李飞飞在社交平台发文称,这是团队实现的"重大里程碑"。Atlas能从单张输入图像重建大型3D场景,以像素级精确度控制相机生成视频帧,还能将多视角图像组合成一致的三维世界。World Labs由李飞飞与来自斯坦福、Google Brain和Adobe的三位联合创始人于2024年创立,公司成立仅两年,2月刚完成10亿美元融资,Autodesk、AMD、英伟达和Fidelity参投。

二、相机位姿原生输入,告别"玄学抽拉"

Atlas最颠覆性的创新,是将相机在三维空间中的位置和姿态直接作为模型的原生输入。过去,视频生成模型接受"镜头缓慢向左拉升"这类自然语言指令,本质仍是在像素空间猜测后续画面,结果全靠运气。Atlas的做法是:你直接告诉模型相机坐标,它就能生成对应视角的画面,最长1分钟、1440p分辨率。

更有趣的是它的"空间脑补力"。输入一张只拍到机器人正面的照片?Atlas能把背影完整生成;给一张泳池边角照,它会自动补全草坪和远山。这背后的核心技术是"Spatial Context"——模型把每张图片绑上三维坐标,在内部搭建带轴网的房间。当视角增多时,它更像是做带空间约束的多视角融合,把零散画面拼成可漫游的连续三维场景。即便两张毫不相干的图片放一起,Atlas也能脑补出走廊、大门和房间。

三、从VFX到机器人,一场空间智能革命

Atlas的底层定位是"空间智能基础设施"。World Labs将Atlas作为旗下3D世界生成产品Marble的底层模型,目前已向少数合作伙伴开放早期测试。VFX(视觉特效)行业预计是首批受益者——以前需要几百个机位拍摄的素材,现在几张照片加上相机轨迹参数就能替代。游戏开发、影视制作、机器人仿真等领域同样前景广阔,因为"让AI理解空间"正是通往通用人工智能的关键一环。综合爱范儿、DeepTech深科技报道 | 2026年9月2日