🎯 科技 · AI大模型
🔥 国产芯片首次以万卡集群撑起超大规模真实流量,单token成本降至英伟达GPU同等水平
8月31日晚间,北京智谱华章科技股份有限公司发布2026年半年度业绩报告,同时披露了一项令业界瞩目的技术突破——旗下GLM-5.3-Flash模型,在上线后6天调用总量突破62万亿token,且全部由国产芯片集群承载。这是国产算力首次在超大规模真实流量场景下,证明了自己不依赖海外高端GPU也能稳定、高效地支撑顶级大模型推理。
数据显示,GLM-5.3-Flash在综合性能上与Claude Opus 4.8持平,但API定价仅为后者的1/40。经智谱自研推理引擎优化后,相同国产硬件上的端到端服务性能提升3倍,单位token推理成本较年初下降80%。这意味着国产芯片已从"单卡可用"迈入"集群好用"的新阶段。
更值得关注的是背后的商业数据:智谱2026年上半年实现营业收入9.54亿元,同比增长399.7%,收入规模超过2025年全年;MaaS平台token调用量较年初增长超40倍,按月度收入年化计算的ARR(年度经常性收入)达16亿美元,周度口径更超过20亿美元。
这一成绩的背后,是智谱过去一年在基础设施领域的密集布局。2026年7月,智谱落地了1GW级国产AI算力数据中心,全部采用国产芯片;同期完成对国产AI异构算力软件公司中科加禾的收购,补齐了编译器、Runtime、推理引擎等基础软件能力。
智谱创始人唐杰在业绩沟通会上表示,过去半年最大的结构性变化是:推理侧不再把海外高端GPU作为唯一规模化路径。"真正重要的是有多少算力能够稳定调度、长期运行,最终转化为模型迭代速度与可计费Token。"
面向未来,智谱已启动下一代基座模型研发,GLM-6.0将瞄准"自进化"方向——让模型具备自我判断、自我修正的能力。唐杰坦言这是"很大的挑战",但也是AI技术演进的必然方向。
综合澎湃新闻、北京日报、每日经济新闻、21世纪经济报道报道 | 2026-09-02