🎯 科技 · AI大模型
🔥 李飞飞World Labs发布全球首个多模态世界模型Atlas,只需1-6张照片即可生成1分钟1440p视频,相机位姿精确控制,空间重建误差仅25.3‰
9月2日,"AI教母"李飞飞创办的World Labs公司正式发布了全球首个多模态世界模型Atlas。这款被公司称为"里程碑式"成果的产品,能够以像素级精确的相机控制生成图像和视频帧,并将其在三维空间中重建,标志着AI从"生成画面"向"生成可进入、可操控的世界"迈出关键一步。
与传统视频生成模型依赖文字提示词"抽奖"不同,Atlas的创新在于将相机位姿参数作为底层原生输入。用户只需输入1到6张普通照片,设定运镜轨迹,即可生成最长1分钟、1440p分辨率的视频。更惊人的是,输入2到25张游客照片就能重建斯坦福大学主方庭的完整3D场景,重建误差仅为25.3‰,优于多个专用3D重建模型。
世界模型的底层逻辑是"空间上下文"。与语言模型处理文本上下文不同,Atlas将每张图片锚定在三维空间的精确位置,附以相机位姿和深度信息,相当于给AI提供了带"坐标轴"和"比例尺"的三维草稿本。这使得模型不仅能生成画面,还能理解世界的物理法则和几何结构。
对于影视特效行业而言,这意味着用几张照片就能还原整个空间场景,大幅降低复杂运镜的制作成本。而对机器人训练来说,Atlas解决了"真实数据匮乏"的痛点——传统方式需要采集大量环境图像并配备昂贵设备,而Atlas仅依靠少量简易素材即可搭建高保真仿真环境。
李飞飞曾在公开采访中表示,语言模型有局限,物理世界的理解和互动能力才是AGI的关键。Atlas被官方称为"有史以来最佳的相机条件世界模型",为从视觉特效到机器人学的众多应用场景打开了大门。随着这一技术的落地,AI正在从"看懂世界"走向"进入世界"。
综合中国证券报、财联社、爱范儿报道 | 2026年9月3日