🎯 科技 · AI
一、AI教母的空间革命来了🔥 李飞飞发布全球首个多模态世界模型Atlas,AI终于学会"理解空间"了
9月2日,"AI教母"李飞飞创办的World Labs正式发布新一代世界模型Atlas。这是该公司成立两年多以来最重要的一次基础模型发布,被李飞飞本人称为"里程碑式"成果。与目前主流的视频生成模型不同,Atlas并非在现有模型上改造,而是从零开始预训练,让文本、图像、视频和3D数据从训练起步阶段就进入同一个模型。
World Labs团队的核心判断是:语言模型让机器学会了处理"文字",下一步则需要让AI真正理解"空间"。Atlas采用多模态自回归扩散Transformer架构,将输入的每一张图片和视频都锚定在三维空间中的一个精确位置,并附有相应的相机位姿和深度信息。
这相当于给模型提供了一个带有"坐标轴"和"比例尺"的三维草稿本,让AI在理解世界时有了明确的几何和物理参考。
二、像素级相机控制重新定义内容创作Atlas展现了三大核心能力。首先是像素级相机控制:只需1到6张图片,就能生成最长1分钟的1440p视频。用户可以像真正的导演一样,精确规划相机的运动轨迹,让AI生成连续、一致的新画面。
其次是"少即是多"的空间重建。传统3D重建需要成百上千张照片,而Atlas在稀疏视角下表现卓越。在DTU等公开数据集测试中,其重建误差为25.3‰,优于多个专用模型。在一个案例中,它仅凭2到25张地面拍摄的照片,就重建了斯坦福大学的整个主方庭,并生成了高空俯瞰的飞行路径。
第三是"子弹时间"与时空模拟。Atlas能处理普通手机拍摄的视频,组成一套多视角拍摄系统,创造出类似《黑客帝国》般的"子弹时间"特效。
一个模型,同时生成视频和重建3D世界,这正是内容创作领域梦寐以求的能力。
三、机器人预训练迎来质变机会Atlas更深远的意义在于打通通往"具身智能"的路。它解决了机器人训练中"真实数据匮乏"的难题——通过少量真实照片,Atlas就能生成一个逼真的三维模拟环境以及机器人传感器会观察到的RGB和深度数据,让机器人在仿真世界里进行海量训练,再迁移到现实世界。
World Labs成立于2022年,由李飞飞与Justin Johnson、Christoph Lassner、Ben Mildenhall共同创立,后几位分别来自计算机视觉、生成式AI和计算机图形学领域。2024年公司以2.3亿美元融资正式走出隐身模式;今年2月又完成10亿美元新融资,其中Autodesk投资2亿美元,AMD、英伟达和Fidelity等也参与其中。
当AI开始用3D视角理解现实世界,一个能同时看到时间和空间的新智能时代正在到来。
综合网易科技、科创板日报、21世纪经济报道报道 | 2026年9月3日