🎯 科技 · AI大模型
🔥 1.5TB旗舰模型压缩至214GB,异构设备联合推理提速6倍,端侧运行旗舰模型门槛大幅降低
9月1日,腾讯混元团队正式宣布推出Hy4 preview轻量版模型,将原1.5TB体量的旗舰模型权重压缩至约214GB,压缩率高达86%。这一突破意味着此前只有顶级数据中心才能运行的旗舰大模型,如今在普通服务器乃至异构设备组合上即可流畅推理,为企业私有化部署打开了新可能。
据腾讯混元介绍,此次压缩核心技术在于两项自研算法:一是Sherry稀疏三值量化算法,将最激进一档权重压至平均1.25比特;二是MIX-STQ1_0混合精度策略,按敏感度逐层决定每层比特数,在同等平均比特预算下实现更低量化误差。压缩后的模型在长文理解、多轮长上下文检索等关键能力上与原始版本基本持平,数学能力仅有小幅回落,整体表现仍在可接受范围内。
日常编码辅助、工具调用、长文档处理和常规问答等场景,该模型均能完整覆盖。从产业部署角度看,权重体量从1.5TB降至约214GB,对显存和存储资源的要求显著下降,企业可在更低成本的服务器环境下完成私有化部署。
更值得关注的是腾讯验证的异构设备联合推理方案。在一台4090笔记本与一台四卡A4000服务器(显存合计80GB、内存64GB)上,通过调度将MoE层拆开分配,协同运行速度达1.02 token/s,较笔记本单机offload提升约6倍。量化GGUF库及相关代码已同步开源,为资源有限的开发者提供了运行旗舰大模型的新路径。
当前大模型竞争已从单纯的参数规模比拼转向部署效率与成本优化。腾讯混元此次推出的轻量版方案,正是回应了企业用户对"既能用旗舰模型能力、又不想扛天价硬件"的核心诉求。随着压缩技术和异构推理的成熟,旗舰模型下沉到边缘侧和中小企业,只是时间问题。
综合界面新闻、金融界报道 | 2026年9月2日