AI芯片路线之争:华为昇腾910C怒砸2.5EFLOPS,廖恒开炮英伟达堆料走到头了

8月4日,华为悄然投下一枚重磅炸弹——基于昇腾910C的万卡级AI智算集群正式落地深圳、武汉、西安三城,总算力达2.5 EFLOPS FP8。这意味华为成为继英伟达之后,全球第二家实现万卡级AI算力规模化部署的厂商。但真正让整个半导体圈炸锅的,是华为半导体首席科学家廖恒随后在一场公开产业访谈中放出的话:英伟达GPU的"Scale-Up堆料路线"已经撞上双重物理天花板,最多再撑两三代就得换道。

廖恒的论点相当犀利——他把英伟达的困境拆成两道死结。一是"内存墙":单卡浮点算力飙得再高,HBM带宽跟不上,大量计算核心干等数据,实际利用率长期不足20%,绝大部分功耗浪费在数据搬运而非有效计算上。二是供电散热天花板:单台AI机柜功率密度突破100kW,传统风冷完全扛不住,液冷也只能延缓而非解决问题。此前老黄在GTC 2026主旨演讲中也罕见松口:AI算力需求虽将达1万亿美元,但单纯堆料已不可持续——这几乎等于公开确认了廖恒的判断。

华为的打法完全不同。昇腾走的是"Scale-Out"分布式路线——不追求单卡峰值,而是用自研高速互联技术把成百上千张卡拧成一股绳,像电网调度电力一样调度算力。这一思路与8月9日刚刚全面投用的曙光8000国产10万卡AI超集群一脉相承:全国产、全液冷、科学计算+智能计算融合,峰值算力相当于全人类持续计算200年。两件事叠加,标志着中国AI算力正式从"跟跑堆参数"切换到"架构级换道超车"。

更值得玩味的是落地速度。深圳某AI企业实测,用昇腾万卡集群跑千亿参数大模型,训练效率比同规模英伟达方案高出约30%,能耗却省了将近一半。这说明华为不是画PPT——是真有货。当然,短板也有:昇腾的软件生态距离CUDA仍有差距,开发者迁移需要时间和成本。但万卡集群+曙光8000先后落地释放出的信号很清楚:国产AI算力自主可控,已经从"能不能造"进化到了"好不好用"的阶段。

AI 生成 . DeepSeek | 搜索综合