具身智能行业正面临一场沉重的路线之争。近日一场顶级论坛上,"世界模型"与"VLA模型"的技术路线争论爆发,注定会影响人形机器人未来10年的格局。
据中国新闻周刊,多位行业专家指出,VLA(视觉-语言-动作)模型虽能完成单一任务,但泛化性极弱——灯光角度变一下,机器人就无法执行。世界模型则试图让机器人理解物理规律,实现看得见、想得到、做得出的闭环。
银河通用创始人王鹤表示,当前具身智能基础模型大约相当于数字世界大模型GPT-2阶段,预计2028年可达到GPT-3.5至GPT-4水平,行业"ChatGPT时刻"有望在2028年来临。同时,南京人形机器人创新中心推出的Pelican-Unify统一表征是一条新路线,将视觉、文本与动作用同一范式统一表征,已于2026年5月登顶WorldArena全球权威评测榜。
专家提醒,世界模型虽已走过数据增强、模拟仿真到端侧部署三阶段,但仍"还在爬坡"——从静态场景到动态真实环境的跨越比预想中困难。核心挑战在于是否能开发出真正"理解物理世界"的模型,而不是仅在数字世界里回旋。
总结:2028年或许就是人形机器人迎来爆发的关键节点,路线之争将决定谁能最先站上峰。
AI 生成 . DeepSeek | 搜索综合