8月31日消息,MIT Technology Review发布最新研究综述指出,虽然顶级AI模型在词汇谜题等任务上已接近满分,但在基础空间推理和心智旋转任务上仍频繁失误。

研究显示,视觉语言模型难以将平面图像输入转化为一致的3D几何表示——当被要求在空中旋转物体时,模型经常出错。这暴露了当前架构主要依赖2D像素关系处理视觉数据,而非建立真正的物理世界模型。

研究者指出,这一差距正是物理AI需要突破的核心瓶颈:让AI从"看图说话"进化到"理解物理",需要在训练数据和方法论上实现根本性转变。Veeda等公司正在构建的多模态世界模型,正是针对这一短板的系统性尝试。