全模态核弹引爆:MiniMax H3把AI卷成六边形战士
当全球还在为纯文本大模型的参数军备烧钱时,MiniMax直接掀了桌子。8月1日发布的H3通用全模态生成模型,一口气打通文本、图像、视频、声音的输入输出闭环,更狠的是原生支持15秒2K分辨率视频直接生成——不是拼接剪辑,不是逐帧修复,而是从语义到画面的一次性端到端输出。这已经不是挤牙膏式迭代,而是把AIGC的赛道从"单科状元"直接改成了"全能十项"。
H3的关键突破在于"原生"二字。此前行业做多模态,普遍是给语言模型戴上翻译耳机——语音转文字再生成,视频拆帧再拼装,误差层层叠加。H3直接从头训练了一个统一语义空间,让四种模态在底层共享同一套抽象表征。这意味着模型能理解"一只戴墨镜的柴犬在雨中跳探戈"这个指令,并直接生成声画同步、表情到位的高清视频,而不是靠预置模板硬凑。技术路线的代差,比参数量的堆砌更难追赶。
耐人寻味的是时间节点。同一天,日本RIKEN推出具身智能基础模型Mebot,韩美联合团队发布全球最大半导体材料知识图谱。三件大事挤在同一天发布,绝非巧合——全球AI军备竞赛已从纯语言模型,全面转向全模态内容生成、物理世界交互、底层材料智能三大纵深战场。MiniMax押注的是内容生产的最短路径,而RIKEN和半导体图谱瞄准的是机器人动作规划与芯片设计自动化。殊途同归,都在争夺下一代AI的物理入口。
回到商业视角,H3最致命的杀伤力在于成本结构。15秒2K视频原生输出,意味着广告片、短视频、游戏过场动画的制作成本可能被压缩一个数量级。当Sora还在为分钟级生成排队算力时,MiniMax已经用工程化能力把全模态生成做成了可量产的产品。这不是实验室里的炫技,而是把AIGC从"能看不能用"推向了"即开即用"的工业化阶段。中国AI公司在应用落地的务实性上,又一次踩准了节奏。
当然,全模态生成的伦理与版权暗礁同样不容忽视——当模型能同时伪造人脸、克隆声音、生成虚假场景时,深度伪造的门槛将被彻底抹平。但技术浪潮从不因担忧而停滞,H3的发布已经把全模态的军备起点抬到了新高度。接下来就看OpenAI和Google如何接招,以及国内厂商能否在算力受限下守住这波先发优势。2026年的AI牌桌,赌注已经从"谁更聪明"变成了"谁更全能"。
AI 生成 · DeepSeek | 搜索综合