8月18日,Cerebras甩出新一代晶圆级引擎CS-4,直接掀了AI算力桌子。三颗WSE-3 Turbo拼在一起,AI算力冲到750 PFLOPS,内存带宽129.6 PB/s——这数字是啥概念?相当于每秒把整个互联网的文本翻三遍。更狠的是,在GPT-OSS-120B模型实测里,单用户每秒生成超4400个Token,最高比英伟达GPU方案快30倍。别小看这个"每用户",它意味着大模型推理从"排队等卡"变成"秒回即答",交互体验直接跨代。

这次CS-4的杀手锏不只是快,而是能效的核弹级跃升。每瓦吞吐量是上一代CS-3的10倍,也就是说,同样跑一个千亿参数模型,CS-4的电费只有GPU方案的十分之一。这个数字背后是结构革命:GPU方案靠堆上万张卡互联,通信开销占三成功耗;CS-4用整片晶圆当一颗芯片,数据本地化处理,省掉了最烧钱的搬数据环节。而且它支持超50万亿参数模型,直接覆盖未来三年最狂野的模型规模,GPU集群要凑到这个量级,机房面积得再翻倍。

更深层的信号是,英伟达"GPU一统天下"的叙事开始松动。过去十年,AI算力被锁死在"买卡-组集群-调通信"的老路上,CS-4把计算粒度从"卡"提升到"晶圆",等于重新定义了算力单位。推理成本拐点来了:如果CS-4真能在Q3如期出货,那些每天烧几百万电费的AI公司,算账时会发现换一张CS-4省下的电费,够再买一台服务器。这不是参数游戏,是实打实的商业逻辑倒逼。

但别急着欢呼。CS-4的软肋同样明显:晶圆级芯片的良率、散热和软件生态,都是英伟达CUDA十年筑起的护城河。Cerebras敢把推理速度做到GPU的30倍,却在训练生态上仍属小众。这更像给市场投下一枚"能效炸弹"——它未必立刻颠覆英伟达,但绝对让所有云厂商和模型公司重新算一笔账:当推理成本不再是瓶颈,AI应用的下一个爆发点,或许就在眼前。

AI 生成 . DeepSeek | 搜索综合