当英伟达还在用H100、B200堆叠算力,试图用通用GPU“包打天下”时,AMD今天扔出了一枚重磅炸弹:正式收购AI芯片初创公司Taalas。这家名不见经传的公司手里握着一张王牌——能把大模型的所有权重直接“烧录”进固定硅片,让Llama 2这类模型的推理速度飙到每秒17000个token。这不是快,这是光速。

传统GPU的运作逻辑是“通用计算”,无论跑什么模型,都得按部就班地读取权重、进行计算。而Taalas的做法是“反向操作”:既然模型参数固定,那就让芯片本身变成这个模型。通过将Transformer架构的权重硬编码进电路,Taalas消除了访存瓶颈,功耗骤降80%的同时,单卡推理吞吐量碾压现有方案。AMD此举直指一个致命问题:当软件定义AI走向尽头,硬件定义AI的时代已经敲门。

这标志着行业正从“通用GPU跑一切”向“为特定模型定制专用芯片”剧烈摇摆。过去十年,英伟达凭CUDA生态构筑的护城河,在“数据飞轮+通用算力”模式下固若金汤。但Taalas的思路从根本上瓦解了“买卡越多越划算”的算力经济学——如果你只运行一个固定的开源大模型,为何要去买一块什么都能干但什么都干不快的GPU?专用芯片(ASIC)对通用GPU的降维打击,正在从比特币矿机、NPU,悄然延伸至大模型推理的核心腹地。

更耐人寻味的是时间节点。就在DeepSeek刚宣布API涨价、行业对推理成本怨声载道时,AMD拿出了一台“光刻机式的印钞机”。Taalas技术一旦量产落地,能效比和成本结构将呈数量级改善,这直接击穿了AI规模化落地的最后一道成本屏障。英伟达或许该紧张了——它的对手不再仅仅是另一家卖GPU的公司,而是一个试图让“GPU无用武之地”的破局者。

AI的摩尔定律或许正迎来分叉:一边是继续卷制程与互联的英伟达,另一边是用硬编码效率碾压软需的AMD。当模型变成硬件,或许我们终将迎来一个“专属芯片如专属App般普及”的AI新世界。

AI 生成 . DeepSeek | 搜索综合