北京时间9月2日,AI科学家李飞飞创办的World Labs正式发布新一代世界模型Atlas,号称全球首个多模态世界模型。该AI模型能够从1至6张普通照片出发,生成最长1分钟、1440p分辨率的视频,并支持像素级精度的相机位姿控制。更关键的是,Atlas可以在仅有2至25张稀疏视角照片的情况下,重建完整的3D场景,为影视特效、机器人训练等领域带来革命性突破,标志着AI大模型从内容生成迈向空间理解的新阶段。
World Labs成立于2024年,今年2月以10亿美元估值完成融资,AMD、英伟达、富达投资等顶级科技机构参与投资。Atlas采用多模态自回归扩散Transformer架构,从底层设计就将文本、图像、视频和3D深度信息统一处理。其核心创新在于"空间上下文"(Spatial Context)机制——不同于大语言模型将输入编码为文本序列,Atlas将每一张输入图像锚定在三维空间中的精确位置,附带相机位姿和深度信息,从而构建出带有"坐标轴"和"比例尺"的三维草稿本,让AI真正理解空间几何与物理规律。
李飞飞在公开采访中指出,语言模型存在天然局限,而物理世界的理解与互动能力才是通向AGI(通用人工智能)的关键一环。Atlas正是为解决这一痛点而生:在机器人训练场景中,传统方式需要采集海量真实环境数据,成本高昂且效率低下;而Atlas只需少量简易拍摄素材,即可生成逼真的三维仿真环境,让机器人在数字世界中完成海量训练后迁移到现实。清华大学智能产业研究院助理教授赵昊评价称,多模态世界模型在表征定义、数据积累和架构设计上均有挑战,Atlas的泛化性很强,对AI机器人行业具有突破性意义。
目前Atlas暂未开源,仅向少数合作伙伴开放早期访问,后续将驱动World Labs旗下Marble等产品。与此同时,国内AI企业也在加速布局世界模型赛道:群核科技已在港股上市,极佳视界、考拉悠然、三岳数维等公司均在推进相关研发。从大语言模型到视频生成模型,再到多模态世界模型,AI对物理世界的理解能力正在快速进化,一场从"看见"到"理解"的技术变革已经到来。
AI大模型正从生成内容走向理解世界,李飞飞与World Labs的Atlas为空间智能和具身智能奠定了关键基石,预示着AI芯片与算力需求将迎来新一轮增长。
AI 生成 . DeepSeek | 搜索综合