??科技 ??AI??????
一、Atlas发布:从「生成图片」到「生成世界」??李?????AI????掀桌!全???????????模???????发布,????AI??????????三维空??
2026年9月2日,「AI教母」李飞飞创办的空间智能公司World Labs正式发布全球首个多模态世界模型Atlas。与当前主流的视频生成模型不同,Atlas不再满足于生成看起来合理的二维画面,而是能够生成具有像素级精确度的图像和视频帧,并将其重建为完整的三维空间。World Labs在官方博客中将其定义为「有史以来最佳的相机条件世界模型」。
Atlas的核心创新在于用「空间上下文」(Spatial Context)替换了传统的「文本上下文」。模型采用多模态自回归扩散Transformer架构,将每一张输入图片和视频锚定在三维空间中的精确位置,并附带相机位姿和深度信息。这相当于给AI提供了一个带「坐标轴」和「比例尺」的三维草稿本,让机器真正理解空间的几何与物理法则。
二、相机控制+空间重建:两张照片重建斯坦福校园Atlas展示了多项颠覆性能力。在「相机控制生成」方面,用户只需输入1到6张普通照片,定好运镜轨迹,Atlas即可生成最长1分钟、分辨率达1440p的视频,镜头角度和运动路线可精确控制。在「空间重建」方面,传统方法需要成百上千张照片才能完成三维重建,而Atlas在稀疏视角下表现卓越——仅凭2到25张地面拍摄的照片,就能重建斯坦福大学整个主方庭,并生成高空俯瞰的飞行路径,重建误差仅为25.3???,优于多个专用模型。
更令人惊艳的是「子弹时间」特效:Atlas能处理普通手机拍摄的视频,将其组合为多视角拍摄系统,创造出类似《黑客帝国》的时空冻结效果。李飞飞在社交平台发文表示:「这是迄今为止最优秀的相机控制世界模型,为从视觉特效到机器人等众多应用场景打开了大门。」
三、打通具身智能最后一公里,机器人预训练迎拐点Atlas最深远的意义,在于为「具身智能」——即让AI拥有物理身体的智能体——打通了从仿真到现实的训练路径。机器人训练长期面临「真实数据匮乏」的瓶颈:在真实世界采集数据成本高、风险大、效率低。Atlas能够用少量真实照片生成逼真的三维模拟环境,让机器人在仿真世界中完成海量训练,再将能力迁移到现实。
World Labs成立于2024年,由李飞飞与来自计算机视觉、生成式AI和计算机图形学领域的三位联合创始人共同创立。公司在2024年以2.3亿美元融资走出隐身模式,2026年2月又完成10亿美元新融资,Autodesk投资2亿美元,AMD、英伟达和Fidelity等也参与其中。分析人士认为,Atlas的发布标志着AI从「语言理解」向「空间理解」迈出了关键一步,机器人产业的训练范式或将因此被彻底改写。综合财联社、科创板日报、爱范儿报道 | 2026年9月2日