🎯 科技 · AI大模型

🔥 智谱GLM-5.3-Flash实现10万级国产芯片规模化推理,单位Token成本较年初下降80%,国产算力第一次在超大规模真实流量下扛住压力

9月1日,智谱在2026年半年度业绩沟通会上扔出一枚"核弹":GLM-5.3-Flash已实现10万级国产芯片规模化推理,这是国产大模型首次在超大规模真实流量下全面依托国产芯片集群提供服务。对比同一硬件的初始基线,该模型端到端服务性能提升3倍,单位Token推理成本较年初下降80%。

这意味着什么?过去半年,中国大模型厂商一直在"缺芯"的阴影下艰难前行——美国芯片禁令让高端GPU成为稀缺资源,智谱也不例外。但唐杰在沟通会上明确表示:"过去半年最大的结构性变化,是推理侧已经不再把海外高端GPU作为唯一的规模化路径。"这句话分量极重,相当于正式宣告国产算力在大模型推理领域完成从"可用"到"好用"的跨越。

具体来看,智谱的打法是"软硬兼施"。硬件层面,公司今年7月落地了1GW级国产AI算力数据中心,全部采用国产芯片;软件层面,收购了国产AI异构算力软件公司中科加禾,补齐编译器、Runtime、推理引擎等基础软件能力。三者叠加,才让10万卡级国产芯片集群的规模化运行成为可能。

更值得关注的是商业模式的变化。智谱已将业务从"卖项目"切换到"卖服务",API收入占比超过八成。这意味着模型能力正在直接转化为可计费的Token收入,MaaS(模型即服务)模式在中国市场得到验证。截至9月1日收盘,智谱市值5490亿港元,港股大模型双雄之一。

面向未来,唐杰将GLM-6.0的方向概括为"自进化"——让模型自己判断何时停止、何时纠正自己。这不仅是技术挑战,更是国产算力持续迭代的底层逻辑。国产芯片的规模化验证,只是第一步。

综合金融界、澎湃新闻报道 | 2026年9月2日