🎯 科技 · AI大模型
🔥 AI从"读懂文字"走向"理解空间",李飞飞Atlas一步打通视频生成、3D重建与机器人仿真
9月2日,"AI教母"李飞飞创办的空间智能公司World Labs正式发布新一代世界模型Atlas,被官方称为全球首个多模态世界模型。这不是在现有视频生成模型上修修补补,而是从零预训练——让文本、图像、视频和3D数据从第一天起就进入同一个模型,统一理解为三维空间。
Atlas的核心创新在于用"空间上下文"替换了传统大模型的"文本上下文"。普通视频模型听到"镜头向左移动",本质上仍在像素空间里猜后续画面;Atlas则把每张输入图像与对应的相机三维位置绑定,放进共享的空间坐标系统中。模型不仅知道"照片里有什么",还知道"照片是从哪里拍的"。当用户改变视角时,新画面与已有空间结构保持一致,缺失部分由模型的世界知识自动补全。
实测数据显示,仅凭1到6张图片,Atlas即可生成最长1分钟、1440p分辨率的视频,用户可像真正导演一样精确规划相机运动轨迹。在稀疏视角3D重建方面,它仅用2到25张地面照片就重建了斯坦福大学主方庭的全景,重建误差仅25.3‰,优于多个专用3D模型。更令人瞩目的是,它能将普通手机视频转化为"子弹时间"效果,让时间冻结、视角自由切换。
对机器人行业而言,Atlas的意义尤为深远。传统机器人训练需要在真实世界采集海量数据,或在昂贵设备上构建仿真环境。Atlas只需少量简易录制素材,就能生成高保真三维模拟场景,让机器人在虚拟世界中完成海量训练后再迁移到现实。清华大学智能产业研究院助理教授赵昊评价:"Atlas的泛化性很强,对于行业具有突破性意义。"
World Labs成立于2024年,今年2月刚完成10亿美元融资,AMD、英伟达、Autodesk等巨头参投。李飞飞将Atlas定义为团队"里程碑式"成果——语言模型让机器学会处理文字,而物理世界的理解与互动能力,才是通往AGI的关键一环。
综合DeepTech深科技、中国证券报报道 | 2026年9月3日