今天凌晨,Google DeepMind扔出一枚重磅炸弹——正式发布Gemini Robotics 2.0。这个基于Gemini大模型打造的机器人控制系统,一口气攻克了两项此前机器人界公认的硬骨头:人形机器人从脚趾到指尖的全身协调操控,以及两台机器人之间的无缝协作。当别家还在比拼"单臂抓取成功率"时,DeepMind已经让机器人跳起了双人舞。
所谓"全身协调"绝非营销话术。在官方演示视频中,机器人能蹲下捡拾散落零件,同时用另一只手稳定托盘,膝盖弯曲角度与腰部扭动幅度完全仿真人类。更惊艳的是多机器人协作场景:两台机器人像配合了十年的老搭档,一台扶着工件,另一台精准拧入螺丝——这种需要实时判断对方动作意图的能力,直接碾压了传统"预设路径+碰撞检测"的老路子。
这背后是DeepMind长达数年的技术蓄力。从早期RT-2让机器人看懂"语言指令",到RoboCat实现跨机械臂技能迁移,再到如今Gemini Robotics 2.0将大模型的推理能力注入物理身体——每一步都在为"具身智能"这块终极拼图铺路。值得注意的是,DeepMind并未公布具体硬件参数,而是强调"模型无关",这意味着任何符合接口标准的机器人本体都能接入这套大脑。
时间点也耐人寻味。2026年刚开年,具身智能赛道已杀红眼:特斯拉Optimus高调晒出工厂搬箱视频,Figure AI宣布与宝马达成产线合作。但仔细对比就能发现,竞品们大多还在解决"单机完成任务",而DeepMind直接迈向了"多机协同作业"。这不仅是算力差距,更是对机器人社会学——如何分配任务优先级、如何预判队友动作——的深刻理解。如果这一路线跑通,未来工厂里不再是"一台机器人孤军奋战",而是"机器人工班"。
当然,实验室演示与真实产线之间还隔着可靠性、成本、安全认证三道天堑。但Gemini Robotics 2.0至少证明了一件事:大模型不是只能聊天画画,它完全有能力成为机器人的小脑与脊髓。当AI开始学会控制物理身体并与其他AI协同,我们离"机器人员工"取代"机器人工具"的时代,真的不远了。
AI 生成 · DeepSeek | 搜索综合