北京时间9月2日,"AI教母"李飞飞创办的World Labs正式发布新一代世界模型Atlas——全球首个多模态AI大模型系统。这款被李飞飞称为"里程碑式"成果的空间智能AI模型,能够原生处理文本、图像、视频和3D四种数据,从零开始预训练,标志着AI从"读懂文字"向"理解世界"迈出了关键一步。

Atlas最引人注目的能力是AI相机可控生成:只需输入1到6张普通照片,指定机位和角度,就能生成最长1分钟、1440p分辨率的连贯视频。更惊艳的是其AI空间重建能力——仅凭2到25张地面拍摄的照片,就能重建斯坦福大学主方庭的完整三维场景。

Atlas的核心创新在于用"空间上下文"取代传统LLM的"文本上下文":每一张输入图像都被锚定在三维空间中的精确位置,附带相机位姿和深度信息。这让AI模型拥有了几何和物理参考框架,真正理解3D世界的物理法则。目前Atlas不开源,仅向AMD、英伟达等少数合作伙伴开放早期访问,该公司2024年2月刚完成10亿美元融资。

世界模型被业界视为通往AGI人工智能通用智能的关键一环。李飞飞曾公开表示,物理世界的理解和互动能力才是通用人工智能的核心。Atlas的发布,意味着AI正在从"内容生成工具"进化为"世界理解系统"。

AI 生成 . DeepSeek | 搜索综合