🤖 人工智能 · 开源生态

🔥 MiniMax H3 开源即登顶全球有声视频编辑榜首,16 家芯片平台首日完成适配,国产视频大模型生态版图全面铺开。

一、模型登顶:从发布到开源只隔三天

8 月 3 日,MiniMax 正式开源新一代通用视频模型MiniMax H3,距其 7 月 31 日发布仅三天。该模型在 Artificial Analysis 有声视频编辑榜单中以 1130 分 Elo 成绩位列全球第一,一举超越 Gemini Omni Flash、HappyHorse-1.0、Wan 2.7 等国内外竞品。

H3 是一个通用型全模态生成系统,可统一理解文本、图像、视频和音频组成的多模态上下文,生成最长 15 秒、最高 2K 分辨率并带有原生立体声音频的视频。模型支持 21:9 到 9:16 多种比例、24 FPS 原生双声道输出,在全模态参考模式下最多可接收 9 张图、3 段视频和 3 段音频作为输入,创作灵活性远超同类模型。

二、技术拆解:三大模块协同的核心架构

H3 系统由H3-Context-IR、H3-Base、H3-Regenerate-2K三个模块组成。Context-IR 负责多模态指令的理解与编排,Base 通过 Omni Transformer 统一编码文本、视觉和音频信息后合成音视频,Regenerate-2K 则不走传统超分路线,而是结合原始上下文对 768p 视频重新生成 2K 画面,更好地还原小文字和精细纹理。

在电商领域,PixPix 已宣布行业首发接入 MiniMax H3,将多模态理解与原生音画能力引入商品内容生产链路。商家可从商品原图出发,一键生成适配 TikTok、Amazon、Shopify 等渠道的横竖版带货视频,覆盖服装、美妆、家居、3C 等品类,实现从商品素材到营销成片的一体化创作。

三、生态破圈:16 家芯片平台首日适配

与模型开源同步,华为昇腾、摩尔线程、沐曦、海光信息、昆仑芯、天数智芯、壁仞科技、AMD、Intel 等 16 家芯片厂商和 Hugging Face、魔搭 ModelScope、ComfyUI、RunningHub、vLLM-Omni、SGLang 等社区与推理框架,均于首日完成了适配。开发者可直接从 Hugging Face 下载模型权重,通过 SGLang、vLLM、diffusers 和 ComfyUI 等多种方式部署。

从模型效果到生态落地,MiniMax H3 的此次开源不仅刷新了有声视频编辑的天花板,更在首日即打通了从芯片到推理框架再到应用工作流的全链路,标志着国产视频大模型从单点突破正式进入生态竞争阶段

综合智东西、凤凰网、MiniMax官方报道 | 2026年8月11日