🎯 科技 · AI大模型
一、旗舰模型"瘦身"成功,压缩近90%体积🔥 腾讯混元推出Hy4 preview轻量版,通过自研量化算法将1.5TB旗舰模型压缩至214GB,企业私有化部署门槛大幅降低
9月1日,腾讯混元团队宣布正式推出Hy4 preview轻量版模型。该版本通过两项核心技术,将Hy4 preview的模型权重从接近1.5TB压缩至约214GB,压缩比例接近90%。两项核心技术分别为:自研Sherry稀疏三值量化算法,可将最激进一档权重压缩至平均1.25比特;以及MIX-STQ1_0混合精度策略,能够按敏感度逐层决定每层比特数,在同等平均比特预算下实现更低的量化误差。
压缩后的模型在主流评测任务上能力保持稳定——长文理解、多轮长上下文检索与原始版本基本持平,数学能力仅有小幅回落,整体在可接受范围内。日常编码辅助、工具调用、长文档处理和常规问答等场景,轻量版均可覆盖。从1.5TB到214GB,意味着模型对显存和存储资源的要求显著下降,企业端在更低成本的服务器环境下完成私有化部署成为可能。
二、异构设备联合推理:笔记本+服务器协同跑旗舰模型除了模型压缩,腾讯混元还验证了一套异构设备联合推理方案。在一台搭载RTX 4090的笔记本与一台四卡A4000服务器(显存合计80GB、内存64GB)的组合上,通过调度将MoE层拆开分配,协同运行的速度达到了1.02 token/s,较笔记本单机offload提升了约6倍。
这一方案的意义在于,它让资源有限或手边已有异构设备的开发者,也能运行原本需要昂贵硬件才能支撑的旗舰大模型。腾讯混元同步开源了量化GGUF库及相关代码,进一步降低了技术门槛。在AI模型日益"巨无霸化"的背景下,如何让普通企业和开发者也能用得起、跑得动,成为模型落地的关键一环。
三、国产大模型轻量化趋势:从"卷参数"到"卷效率"与阿里云Qwen3-VL-Rerank同日降价、智谱GLM-5.3-Flash依托国产芯片实现推理成本下降80%等动向相呼应,腾讯混元此次推出轻量版,折射出国产大模型竞争正从"卷参数规模"转向"卷效率与性价比"。
头部厂商们正在通过模型压缩、量化、异构推理优化等技术路径,降低大模型的部署和使用门槛,让更多企业能够在可控成本下获得前沿AI能力。对于需要处理长文档、多轮检索场景的机构用户而言,长上下文能力接近原版的同时部署成本大幅下降,正是轻量版模型在企业AI应用落地中的核心价值所在。
综合金融界、凤凰网科技报道 | 2026年9月2日