北京时间9月2日,人工智能科学家李飞飞创办的World Labs正式推出新一代世界模型Atlas。这款被李飞飞称为"全球首个多模态世界模型"的新产品,能够以像素级精确的相机控制生成图像和视频帧,并将内容在3D空间中重建。

Atlas的核心能力在于"理解世界"——它不仅能生成视觉内容,还能通过输入单张或多张图像,输出1440p分辨率、时长1分钟的视频,并同步生成显式三维场景。World Labs披露,Atlas可依据输入图像重建现实世界场景,对视频进行空间与时间建模,甚至将两张毫无关联的参考图像放入三维空间上下文,在两者之间生成平滑过渡的虚拟世界。

这一技术突破对两个领域意义重大:影视工作者可用几张照片快速还原场景,大幅降低虚拟制片成本;机器人训练者可借助Atlas在数字世界构建仿真环境,避免传统方式需采集大量真实环境图像的昂贵成本。清华大学智能产业研究院助理教授赵昊评价:"Atlas的泛化性很强,对于行业具有突破性意义。"

World Labs成立于2024年,今年2月已获10亿美元融资,投资方包括AMD、英伟达、富达投资等科技与资本巨头。李飞飞曾表示,语言模型有局限,物理世界的理解和互动能力才是AGI的关键一环。Atlas的发布,标志着多模态世界模型正从技术探索走向产业应用,AI对物理世界的认知能力再进一步。

AI 生成 . DeepSeek | 搜索综合