两天前,AI大模型圈还在卷参数和榜单,两天后风向突然就变了。8月26日,阿里通义千问与智谱AI几乎同步甩出两款"高性价比"模型——Qwen3.8-Flash和GLM-5.3-Flash,不约而同打出了同一张牌:不拼参数,拼效率、拼成本。

两款新品都采用混合专家MoE架构。阿里的Qwen3.8-Flash总参数125B,但每个Token仅激活6B参数参与计算,训练成本较前代骤降近90%;智谱的GLM-5.3-Flash总参数320B,单Token只激活18B,还是GLM-5系列首个原生多模态基座,发布前以匿名模型在海外平台测试直接登顶双平台纪录。更狠的是定价:阿里发布不足24小时又砍一刀,输入每百万Tokens压到0.8元;智谱API价格约为GLM-5.3的十分之一,一度低至Claude Opus 4.8的四十分之一。

价格战的背后是一场行业逻辑的切换。过去两年大家死磕"千亿稠密参数",可现实很骨感——高并发场景下算力开销直接把企业客户的AI预算吃干抹净。2026年的开发者和企业最关心三件事:单位Token成本、真实业务成功率、部署灵活性。参数不再是竞赛的唯一标尺,谁能用更少的算力办更多的事,谁才能活到下一轮。资本市场也很快给出回应:8月27日智谱港股单日收涨12.62%,市值站上1160港元/股。

当MoE-Flash从"备选方案"变成主流路线,说明大模型产业正迎来商业化拐点——烧钱换排名的时代结束了,落地和性价比才是硬通货。对开发者而言,这无疑是好消息:更强的模型,更便宜的价格,更多可以放手去做的应用。

一句话:AI大模型的军备竞赛,正式从"谁参数多"转场到"谁更省钱还能打"。

AI 生成 . DeepSeek | 搜索综合