🤖 AI · 世界模型
一、从ImageNet到世界模型,李飞飞的第三次跨界🔥 李飞飞World Labs发布Atlas世界模型,AI从语言迈向具身智能
北京时间9月2日,"AI教母"李飞飞旗下人工智能公司World Labs宣布推出新一代世界模型Atlas。这是李飞飞继创建ImageNet数据集、创办World Labs并获得10亿美元融资(投资者包括AMD、英伟达、富达投资)之后的又一里程碑式成果。Atlas能结合图像、视频等输入,生成具备精准镜头控制的图像和长视频,并通过输入的图像重建3D空间。
这是全球首个多模态世界模型,宣称能够以像素级精确的相机控制生成图像和视频帧,并将其在3D中重建。World Labs官方表示,其从头开始对Atlas进行预训练,使其能够接受多模态输入,并将其转化为3D视图。通过输入单张或多张图像,Atlas最高可输出1440p分辨率、时长1分钟的视频。
二、"空间上下文"取代"文本上下文",底层架构革命Atlas的核心创新在于用"空间上下文"(Spatial Context)替换了传统大模型处理"文本上下文"的方式。与大语言模型LLM类似,Atlas首先将各类输入信息编码为上下文,再依据上下文生成输出内容。但每一张图像都会锚定在三维空间中的对应位置,由此构建出空间上下文。这使得Atlas模型具备世界认知能力与创造力。
演示中,Atlas可以将两张毫无关联的参考图像放入上下文,并在三维空间中设定好二者的位置,随后就能生成一个在两张图像的内容之间实现平滑过渡的世界。清华大学智能产业研究院助理教授赵昊评价:"Atlas的泛化性很强,对于行业具有突破性意义。"
三、影视特效+机器人训练,两大应用场景率先落地Atlas的应用场景主要集中在两个方向:创意工作和机器人训练。对于影视工作者而言,几张照片就能还原空间场景,大幅开拓创作空间;对于机器人模型训练,传统方式需要采集环境图像上传并使用昂贵专业设备,而Atlas仅依靠少量简易录制素材,就可以辅助搭建仿真环境,同时还原物体的运动方式与交互行为。
李飞飞曾在公开采访中表示,语言模型有局限,物理世界的理解和互动能力是AGI的关键一环。当ChatGPT能写出完美文章却无法告诉孩子"杯子摔碎了"时,世界模型或许正是那条通向真正通用人工智能的必由之路。
综合中国证券报、科创板日报、163科技报道 | 2026年9月3日