CMU一项历时31天、覆盖756块GPU(从A6000到B200共六代)的遥测研究揭开了AI圈最隐秘的浪费:近20%的执行时间和11%的能耗,竟全部消耗在"伪忙"的execution-idle状态。更触目惊心的是推理场景——Azure Code负载下65%的能耗在空转,OpenAI Chat类请求也有52%能耗白白流失。换句话说,你花重金买来的"生产力",有一半时间在摸鱼烧电费。
这笔账在顶级硬件上被放大到荒诞:一台GB200 NVL72机柜售价约400万美元,若利用率仅50%,等于200万美元直接打了水漂。而将利用率从50%推至90%,效果堪比凭空多赚一台机柜。行业正疯狂追问:算力军备竞赛的下半场,拼的已不是谁买得起GPU,而是谁能让每一块硅片都满负荷"搬砖"。AI Infra的四层架构——能源、硬件、系统软件(CUDA/编译器/通信库)、服务编排(推理引擎/请求调度)——注意力正从底层的"堆料"急速上移到软件层"榨汁"。
资本已用脚投票。开源推理引擎vLLM和SGLang前后脚宣布商业化,种子轮均超1亿美元,背后站着AI产业所有巨头与顶级VC;Baseten估值从21亿飙至130亿,Fireworks七个月估值翻四倍达175亿美元。软件层的"黄金时代"正式开启。而巨头们的军备竞赛仍未停歇——Meta、Google、Microsoft今年合计AI资本开支预计超1万亿美元,黄仁勋更预测2030年全球AI基础设施年投资将达4万亿美元。但华尔街的担忧也在升温:基建狂魔烧钱无度,回报何时兑现?
解法已在路上。核心优化方向锁定为KV Cache复用、计算复用、消除等待与提升协同——Anthropic靠这套组合拳把推理成本砍掉90%,其Infra团队已扩张至200多人。更激进的玩家直接"硬造":谷歌秘密研发Frozen v2服务器芯片,将Gemini架构固化进硅片;OpenAI与博通联合打造的推理芯片Jalapeño,从设计到流片仅用9个月。当软件优化触及天花板,把算法"烧"进芯片,就是下一轮效率跃迁的终极答案。
算力富矿的挖掘,正从"挖得多"转向"挖得净"。谁能把每一度电、每一颗晶体管都变成智能,谁才是这场万亿美元豪赌的真正赢家。
AI 生成 · DeepSeek | 搜索综合