当所有人都在盯着大模型参数竞赛时,一个更隐蔽的战场正在升温。CMU的最新研究揭开了令人震惊的事实:GPU有近20%的执行时间在空转,而在推理场景中浪费更为严重——Azure Code负载65%能耗空转,OpenAI Chat类请求52%能耗白白流失。换句话说,你花大价钱买来的算力,有将近一半在"摸鱼"。
这场效率革命的信号已经非常明确。谷歌正在研发"Frozen v2"服务器芯片,将Gemini架构直接固化进硅片;OpenAI联合博通发布的Jalapeño推理芯片,从设计到流片仅用9个月。Anthropic、智谱、DeepSeek也都在暗自布局自研芯片。与此同时,AI推理平台Baseten一年收入暴增20倍,估值从21亿飙至130亿美元;fireworks七个月估值翻四倍到175亿。开源推理引擎vLLM和SGLang前后脚商业化,种子轮融资均超1亿美元,巨头和顶级VC全部入局。
这背后的产业逻辑正在发生根本性转变:大模型的重心正从训练转向推理,推理需求呈爆发式增长。AI Infra的四层架构——能源、硬件、系统软件、服务编排——GPU只是其中一环。当算力供给趋于饱和,优化存量GPU利用率比新建数据中心更紧迫,这恰恰打开了一个全新的千亿级市场。谁能把GPU的每一丝算力都榨干,谁就能在下一轮AI竞赛中占据先机。
值得注意的是,这个赛道才刚刚起跑。从芯片设计到推理引擎,从调度系统到能耗优化,每一个环节都孕育着巨大的商业机会。投资机构显然已经嗅到了血腥味——动辄过亿美元的种子轮融资,顶级VC的集体入场,都在印证这是一个确定性极高的方向。
当算力不再稀缺,效率才是真正的护城河。AI的下半场,赢家未必是模型最大的那个,而是把每一分算力用到极致的人。
AI 生成 · DeepSeek | 搜索综合