🎯 AI科技 · 李飞飞

🔥 李飞飞旗下World Labs发布全球首个多模态世界模型Atlas,2张照片即可重建3D空间,AI从"看懂图片"进化到"理解世界"

9月2日,"AI教母"李飞飞创办的World Labs正式发布全球首个多模态世界模型Atlas。这款模型不再满足于生成图片或文字,而是能够理解并重建具有像素级精确度的3D世界,被李飞飞本人称为团队"里程碑式"成果。

与传统大模型不同,Atlas的核心创新在于用"空间上下文"替换了"文本上下文"。它采用多模态自回归扩散Transformer架构,将输入的每一张图片都锚定在三维空间中的精确位置,并附带相机位姿和深度信息。这意味着AI不再只是"看图说话",而是真正理解了世界的几何结构和物理法则。

一、2张照片重建整个空间

Atlas最引人注目的能力是"少即是多"的空间重建。在公开数据集DTU测试中,Atlas的重建误差仅为25.3‰,优于多个专用3D重建模型。更具戏剧性的是,研究人员仅用2到25张游客拍摄的地面照片,就重建出了斯坦福大学主方庭的完整3D场景,并生成了高空俯瞰的飞行路径视频。传统3D重建技术通常需要成百上千张照片才能达成类似效果。

在视频生成方面,Atlas只需1到6张图片,即可生成最长1分钟的1440p高清视频,且用户可以像导演一样精确规划相机运动轨迹。更酷的是,它能将普通手机拍摄的视频转化为多视角系统,实现《黑客帝国》式的"子弹时间"特效。

二、机器人预训练打开新大门

Atlas更深远的意义在于打通了通往"具身智能"的关键路径。机器人训练长期面临"真实数据匮乏"的困境——让机器人在真实世界中试错成本太高,而仿真环境又难以还原真实物理特性。

Atlas通过少量真实照片就能生成逼真的三维模拟环境,以及机器人传感器会观察到的RGB和深度数据。这意味着机器人可以在高度仿真的虚拟世界中进行海量训练,再迁移到现实世界,效率将得到质的飞跃。清华大学智能产业研究院助理教授赵昊评价称:"Atlas的泛化性很强,对于行业具有突破性意义。"

三、从视觉特效到AGI的关键一步

World Labs的野心不止于此。Atlas的3D理解能力可应用于视觉特效制作、游戏开发、虚拟制片、室内设计等多个领域。创作者只需输入文本描述,即可生成图像及360°全景图,还能精准呈现文字、驾驭丰富视觉风格。

李飞飞曾公开表示,语言模型有局限,物理世界的理解和互动能力才是AGI的关键一环。随着AI从"生成信息"向"理解世界"演进,Atlas的发布标志着多模态世界模型正式迈入实用阶段,也为机器人技术和具身智能的突破奠定了重要基础。

综合科创板日报、界面新闻、中国证券报报道 | 2026-09-03