🤖 人工智能 · 具身智能 · 全模态大模型
一、榜单含金量:不是刷分,是真实物理世界的"全模态大考"🔥 智元自研的WITA-Omni Preview以85.21分登顶DailyOmni全模态理解榜单,在八项细分指标中拿下六项第一,超越千问、Gemini、豆包和英伟达等国内外大模型,标志着中国具身智能交互能力迈入全球第一梯队。
DailyOmni并不是又一个容易刷分的图文评测,而是行业公认的检验大模型音视频时序对齐与跨模态联合推理能力的权威第三方榜单。它大量采用真实开放环境的音视频素材,核心考察模型是否能在复杂物理空间中融合视觉画面和环境音频,精准判断"谁在说话""事件发生先后顺序"。
这对人形机器人意味着什么?传统大模型评测大多停留在图文理解层面,而具身智能需要模型像人一样"眼看六路、耳听八方"——看到杯子倒了,同时听到碎裂声,并能推理出因果关系。这才是DailyOmni榜单真正的含金量所在。
二、架构突破:Thinker-Talker-Actor三层端到端,比"听看说动"割裂方案强在哪WITA-Omni领先的关键,不是简单地把聊天模型塞进机器人。智元独创了"思考-表达-行动"(Thinker-Talker-Actor)三层端到端架构,将物理动作和表情提升为与语音并列的一级输出——Thinker负责跨模态联合推理,Talker流式生成自然语音,Actor由动作头和表情头驱动肢体表达。
这种原生端到端设计,解决了传统机器人"听、看、说、动"各模块独立导致的交互生硬割裂痛点。在多人、开放且持续变化的真实环境中,WITA-Omni能自主判断该不该回应、何时回应、正在与谁交互,这正是过往模块化方案难以跨越的能力鸿沟。
三、训练密码与产业落地:千万小时数据+三阶段特训,已拿下全国首张备案通行证WITA-Omni的领先并非靠堆参数。它使用千万小时级多模态数据基座,经过"监督微调-同策略蒸馏-强化学习"三阶段针对性训练,通过"老师-学生"模拟机制配合奖惩体系,让模型既保持表达风格统一,又大幅提升复杂音视频上下文中的推理能力。
更值得关注的是,今年5月硅光动语大模型已通过备案,成为全国首款合规备案的具身智能交互大模型,正式进入商用阶段。未来它将与智元的VLA操作模型和世界模型GE-Sim 2.0深度协同,加速人形机器人在商业服务、公共导览等场景的规模化落地。榜单前三名中国产模型占两席,也印证了中国在全模态感知领域已形成集群优势。
综合广州日报、上观新闻(解放日报)、广州市科学技术局报道 | 2026-07-31