🤖 人工智能 · 具身智能
一、榜单登顶:中国机器人"大脑"逆袭硅谷🔥 智元WITA-Omni Preview以85.21分力压谷歌Gemini和英伟达,在具身全模态理解领域宣告中国力量的弯道超车。
7月28日,具身全模态理解权威榜单DailyOmni公布最新评测结果,智元自研的WITA-Omni Preview模型以85.21分综合成绩登顶全球榜首,一举超越谷歌Gemini、阿里千问、字节豆包以及英伟达等国内外顶尖模型。这份成绩单不仅是一串数字——在八项细分指标中,智元拿下六项第一,#超越谷歌和英伟达智元交互模型登顶全球榜首#的话题迅速在AI圈刷屏,所有人都意识到:人形机器人的"大脑竞赛"格局正在被改写。
DailyOmni并非普通的图文评测榜单,它大量采用真实开放环境的音视频素材,核心考验的是模型融合视觉画面与环境音频信息、精准识别声画对应关系和事件时序的综合能力。这恰好是人形机器人在物理空间进行自然交互的核心痛点——传统方案在这一关几乎"集体翻车"。
二、技术突破:从"听见看见"到"真正理解"对于机器人的交互能力来说,"理解"和"回应"从来不是两个割裂的步骤,而是一个持续发生的物理过程。以往的多模态模型大多优先适配线上数字内容,而机器人身处不断变化的真实环境,既要同步捕捉画面和声音,还要实时判断声音归属哪个主体、事件发生的先后顺序,找准交互对象和回应时机。
WITA-Omni Preview的核心突破就在于"具身原生"——从设计之初就为人形机器人的物理交互场景而生。它不像传统模块化方案那样把视觉、听觉、时序推理拆成三个独立模块再强行缝合,而是端到端地融合多模态信息,让机器人在嘈杂环境中也能判断"谁在说话""什么时候该回应""当前正在发生什么",这从根本上解决了人机交互生硬割裂的行业难题。
三、产业拐点:具身智能从实验室走向现实智元此次登顶,恰好踩在了具身智能产业爆发的关键节点上。2026年以来,全球人形机器人赛道融资持续升温,特斯拉Optimus、Figure AI等海外选手加速推进,而国内智元、宇树等企业也在快速迭代。WITA-Omni Preview的登顶意味着中国在具身智能的"大脑"层面已经具备全球竞争力,不再只是硬件制造的跟随者。
值得关注的是,DailyOmni榜单的评测标准高度贴合真实物理场景,能在这个榜单上超越英伟达和谷歌,说明中国团队在解决机器人"感知-理解-决策"这条核心链路的能力已具备国际领先水平。下一步的看点是:这颗强大的"大脑"何时搭载到量产机器人上、走入工厂、家庭和商业场景。
综合广州日报、智元官方报道 | 2026年7月31日