🤖 人工智能 · 前沿科技
一、从叠衣服开始,AI终于"理解"了空间🔥 李飞飞携Atlas重返C位,世界模型从"生成画面"跃升至"生成可进入的世界"
北京时间9月2日,"AI教母"李飞飞创办的World Labs正式发布全球首个多模态世界模型Atlas。这不是又一次"又发了个新视频模型"的例行更新,而是一次底层范式的迁移——AI不再只是生成一张张静态画面,而是开始理解三维空间、相机位姿和物理规律。
发布会现场展示了一段令人惊艳的视频:李飞飞本人在办公室里叠衣服,光影、褶皱、手部动作无一不真实,连李飞飞自己都笑称"我们办公室里确实真的在叠衣服"。这段视频的惊人之处在于,它不是用大量素材堆出来的,而是Atlas仅凭1到6张参考照片,配合用户指定的运镜轨迹,就生成了最长1分钟、1440p分辨率的流畅视频。
World Labs将这项核心技术称为"空间上下文"——每一张输入图像都被锚定在三维空间的具体位置,带着相机位姿一起进入模型,不再依赖模糊的文字描述。
二、相机不再是"拉老虎机",而是"坐进导演椅"过去让视频模型"向左推轨"或"升降镜头",只能把电影术语写进提示词,模型理解到什么程度是个黑箱。Atlas彻底改变了这个局面。它原生支持相机位姿作为输入类型,创作者可以通过指定精确的机位、角度和运动轨迹来控制生成结果。
官方测试数据显示,在相机可控生成评测中,Atlas对MiniMax H3的胜率为75%,对Gemini Omni Flash为81%,对阿里HappyHorse 1.1为86%,对FLUX 3为93%,对字节Seedance 2.5为94%。World Labs也坦诚说明:这些对比模型不接受相机位姿作为原生输入,运镜只能靠文本描述,因此差距某种程度上反映的是"原生相机接口"对"文本描述运镜"的代差。
更令人瞩目的是Atlas的空间重建能力。仅需2到25张普通手机拍摄的照片,就能重建出高保真的3D场景,输出点云和3D高斯泼溅等显式三维结果。斯坦福主方庭的案例中,仅仅用2到25张地面照片,Atlas就生成了远高于校园的航拍飞行路径,画面流畅度令人惊叹。
输入图越多,Atlas的"想象"成分越少——单张照片时大量补全空白,两三张时开始忠实重建,超过一百张时可精确还原细节。
三、不止是特效工具,更是机器人训练的"新引擎"Atlas的战略野心远不止于影视特效和游戏。World Labs今年7月收购了仿真公司SceniX,Atlas正是这一战略布局的首个重大落地。在机器人训练领域,传统Real-to-Sim流程需要专业设备采集环境数据,成本高、周期长。Atlas只需手机视频扫描两个大型环境、每环境取24帧,就能生成机器人机身相机在每一步应看到的RGB和深度数据。
这意味着,机器人公司可以用极低的成本构建高保真仿真环境,让机器人在虚拟世界中完成大量训练,再迁移到现实。World Labs表示,Atlas还能捕捉刚体、铰接体和可变形物体的交互,支持替换物体、改变位置、调整光照和背景来批量生成训练变体。
清华大学智能产业研究院助理教授赵昊评价道:"多模态世界模型的难点包括表征怎么定义、数据怎么积累、架构怎么设计。从呈现的效果看,Atlas的泛化性很强,对于行业具有突破性意义。"
从Marble到Atlas,World Labs用一年半时间完成了一次清晰转向:从"生成好看的世界"到"生成够用的世界",而这正是AI通向AGI的关键一步。
综合界面新闻、机器之心、中国证券报报道 | 2026年9月3日