🎯 科技 · 国产AI大模型
一、国产芯片首次大规模"出海远征"🔥 10万张国产芯片扛住百万Token级流量,推理成本砍掉80%,国产"芯模协同"跑通商业闭环
9月3日,智谱科技公布的一份数据引发业界震动:旗下开源大模型GLM-5.3-Flash的全部线上流量,由超过10万张国产AI加速芯片组成的集群承载。这是国产算力芯片首次以"集体出海"的方式,直接服务全球真实负载——该模型在正式发布前以匿名身份"Ox-Alpha"登陆OpenRouter等海外平台,6天Token调用量突破62万亿,登顶双平台历史纪录。
这不是实验室里的演示,而是真金白银的市场检验。中国信息通信研究院华东分院数字化与新兴科技事业部副主任高庆浩评价称,这一成绩完成了三重验证:工程可用性——证明国产芯片不是"实验室产品";成本竞争力——单位Token成本追平主流英伟达GPU;商业闭环——首次在全球场景证明可盈利、可服务。
二、成本降80%背后的工程奇迹GLM-5.3-Flash的推理成本为何能大幅压缩?智谱给出的答案是"软硬件一体化深度解耦"。该模型采用面向低成本推理设计的新架构,注意力计算量相比主模型降低3.01倍,键值缓存显存占用降低4.44倍。搭配SGLang推理引擎与编码、预填充、解码分离的并行架构,端到端服务性能较初始基线提升3倍。
价格层面同样惊人:GLM-5.3-Flash官方定价仅为旗舰版GLM-5.3的十分之一,限时折扣期间低至二十分之一,相当于Claude Opus 4.8的四十万分之一。一个日活50万的自动化客服智能体,若用传统旗舰模型,月算力开销超45万元;切换至Flash模型后,单日API费用骤降至1000元以内,降幅超过90%。
成本降幅直接决定AI应用是盈利还是亏本——这是大模型从"能力竞赛"转向"经济理性"的关键拐点。
三、国产AI芯片的"主场"在哪?智谱的实践揭示了一个产业规律:推理侧是国产芯片的"主场"。相比训练对单卡峰值算力的极致要求,推理更看重吞吐、时延和单位成本,恰好契合国产芯片"以规模换性能、以协同换效率"的打法。2026年上半年,国产AI芯片厂商营收普遍暴涨,寒武纪归母净利润同比增122.61%,海光信息增49.69%,沐曦股份和天数智芯首次实现中期盈利。
不过挑战依然显著:HBM国产化尚未突破、先进制程受限、万卡集群稳定性待验证、CUDA生态迁移惯性大。业内专家指出,当前协同集中于头部模型/头部芯片(以昇腾最充分),长尾覆盖不足、各家算子栈仍碎片化,是下一步需要攻克的硬骨头。
综合每日经济新闻、南方都市报、钛媒体报道 | 2026年9月4日