🎯 科技 · AI

🔥 李飞飞发布Atlas世界模型,全球首个多模态世界模型横空出世,相机控制从"文字玄学"进化到"像素级精确"

一、从"生成画面"到"生成世界"

2026年9月1日,"AI教母"李飞飞创办的World Labs正式发布了新一代世界模型Atlas。官方将其定义为"全球首个多模态世界模型",能够原生处理文本、图像、视频、相机位姿与3D深度信息,在同一套模型中完成世界生成、空间重建和时空模拟。

#李飞飞新动作 新一代世界模型发布#引发科技圈广泛关注。World Labs成立于2024年9月,以2.3亿美元启动资金起步,两年时间完成从"生成好看的世界"到"生成够用的世界"的跃迁。

二、核心能力:空间上下文取代文本上下文

Atlas最颠覆性的突破,在于将相机控制从"文字玄学"变成了"像素级精确"。过去,用户在视频生成模型的提示框里输入"镜头缓慢向左拉升、绕着人物微仰角旋转",结果全凭运气。Atlas的做法是把"相机位姿参数"作为底层原生输入,直接给定坐标即可。

只需输入1到6张普通照片,定好运镜轨迹,Atlas就能生成最长1分钟、1440p分辨率的视频。空间重建方面,传统3D高斯泼溅或点云扫描需要扛着专业设备围着目标转几十圈、拍几百上千张照片。Atlas在斯坦福大学Main Quad的演示中,仅用2到25张游客视角的照片,就还原了草坪、拱廊和纪念教堂外墙的全部细节。

核心架构是"空间上下文"——每一张图像都被锚定在三维空间的具体位置,带着相机位姿一起进入模型。

三、12亿美元弹药加持,机器人时代序幕

Atlas发布正值World Labs资金弹药充足之际。李飞飞本人将其视为公司的"里程碑式"成果,在社交平台置顶称:"Atlas为从视觉特效到机器人的众多应用场景打开了大门。"其高徒、英伟达机器人主管Jim Fan评论:"这是机器人领域Real-to-Sim的一大步。"

时空模拟能力让Atlas能根据输入视频同时建模空间和时间,支持视频重新构图和机器人的Real-to-Sim工作流。

综合封面新闻、i黑马报道 | 2026-09-04