🎯 人工智能 · 世界模型
一、从ImageNet到Atlas:李飞飞的下一步🔥 李飞飞发布Atlas世界模型,2张照片即可重建完整3D空间,AI从"生成画面"迈向"生成世界"
当地时间2026年9月1日,"AI教母"李飞飞联合创办的World Labs发布了新一代世界模型Atlas。这是全球首个多模态世界模型,能够原生处理文本、图像、视频、相机位姿与3D深度信息,并在同一套模型中完成世界生成、空间重建和时空模拟。2024年9月,李飞飞以2.3亿美元启动资金创办World Labs,今年2月公司宣布获得10亿美元融资,投资者包括AMD、英伟达、富达投资等顶级机构。
李飞飞曾创建ImageNet数据集,推动了计算机视觉算法的革命性发展。如今,她将目光投向了更宏大的目标——让AI理解并生成物理世界。她在社交平台置顶称:"Atlas为从视觉特效到机器人的众多应用场景打开了大门。"
二、2张照片重建3D世界,相机控制从"玄学"到"像素级精确"Atlas最直观的突破在于将相机控制从"文字玄学"变成了"像素级精确"。过去,用户在视频生成模型的提示框里输入"镜头缓慢向左拉升",结果全凭运气。Atlas把"相机位姿参数"作为底层原生输入,只需输入1至6张普通照片,定好运镜轨迹,就能生成最长1分钟、1440p分辨率的视频。
在空间重建演示中,Atlas仅用2到25张游客视角的地面平拍照,就在斯坦福大学Main Quad还原了草坪、拱廊和纪念教堂外墙的全部细节,并生成了上帝视角航拍漫游。在DTU、ETH3D、ScanNet等公开数据集上,其稀疏视角重建误差达到了25.3。核心设计"空间上下文"让每一张图像都被锚定在三维空间中的具体位置——你可以把两张毫不相关的参考图放入上下文,指定它们在三维空间中的相对位置,Atlas会自动补全中间的世界。
三、从影视特效到机器人训练:世界模型的应用蓝海World Labs将Atlas的能力划分为四类:相机控制生成、空间重建、时空模拟和图像生成。对于影视工作者,几张照片即可还原空间场景,大幅开拓创作空间。对于机器人领域,传统Real-to-Sim需要将真实环境用昂贵设备扫描录入,而Atlas仅依靠少量简易录制素材即可搭建仿真环境,还原物体运动方式与交互行为。
英伟达机器人主管Jim Fan评价:"这是机器人领域Real-to-Sim的一大步。"清华大学智能产业研究院助理教授赵昊认为,多模态世界模型的难点包括表征定义、数据积累和架构设计,从呈现效果看,Atlas的泛化性很强,对行业具有突破性意义。随着AI从大语言模型、视频生成模型向世界模型演进,"生成够用的世界"正在成为下一代AI基础设施的核心能力。
综合封面新闻、中国证券报、爱范儿报道 | 2026-09-03