🤖 芯片 · 英伟达

🔥 英伟达悄然重启一度"取消"的推理预填充专用GPU项目Rubin CPX,2027年Q1量产,专为百万Token长上下文推理而生,推理成本有望大幅降低。

9月1日,天风国际证券分析师郭明錤发布最新产业调查,一个曾被市场认为"已取消"的英伟达芯片项目突然回归——Rubin CPX,一款专为AI推理预填充(Prefill)阶段优化的GPU,预计将于2027年第一季度正式投产。

这款芯片从2025年GTC大会首次亮相,原计划2026年底上市,但随后一度从产品蓝图中消失。如今重启并经过"大幅度调整",释放出一个明确信号:英伟达正在全力攻坚AI推理成本这个最大的行业痛点。

据郭明錤披露,新版Rubin CPX在算力上已接近标准Rubin GPU,单卡最高功耗维持在2300瓦,内存则从原计划的128GB GDDR7升级为168GB HBM4,虽仍低于标准Rubin的288GB HBM4,但已足够覆盖大多数长上下文推理的KV Cache需求。

一、为何预填充如此关键

在AI大模型推理的全流程中,预填充阶段负责处理海量输入Token并生成KV Cache,是决定推理延迟和成本的核心环节。郭明錤指出,目前超过50%的AI推理工作负载来自输入上下文处理和KV Cache构建,这意味着预填充效率直接决定了云厂商的运营成本。

以ChatGPT类应用为例,用户输入一段长篇 Prompt,模型需要先"读完"所有内容才能开始生成回答。这个"读"的过程就是预填充,耗时最长、算力消耗最大。CPX正是针对这一环节量身定制的专用加速器。

8卡CPX计算托盘可配备约1.34TB HBM4内存,足以支撑绝大多数百万Token级别的大模型预填充任务,无需像通用GPU那样为边缘场景预留大量冗余算力。

二、架构全面重构

新版CPX与旧版相比,在五个维度进行了大幅调整:芯片规格、机柜设计、互联架构、运作模式和产品定位。

最大的变化在于机柜部署方式。旧版CPX计划与Rubin GPU共享机架,新版改为采用独立MGX ETL机柜,客户可按需配置64、128、192或256颗CPX,灵活扩展预填充算力,无需捆绑购买完整Rubin机架。

互联架构也做了分层优化:单托盘内8颗CPX通过NVLink Scale-up互联,带宽1至1.5TB/s;托盘间则通过Spectrum-6以太网实现Scale-out,跨机柜用OSFP光纤连接。相比全NVLink方案,成本大幅下降。

三、推理经济性革命

英伟达建议CPX与Vera Rubin NVL72的搭配比例为1:1——CPX负责预填充和KV Cache建立,再通过以太网RDMA传输给Rubin执行解码生成。这种"分工协作"模式,有望让推理整体成本显著下降。

招商证券分析认为,AI推理市场空间巨大,随着大模型上下文长度持续扩展,预填充优化芯片将成为继训练GPU之后的下一个百亿级赛道。CPX的推出,标志着英伟达从"训练单边突进"走向"训推全面覆盖"的战略深化。

对于云厂商和AI应用企业而言,推理成本的每一下降,都意味着更低的用户门槛和更大的商业空间。Rubin CPX能否成为AI推理的"甜蜜点",2027年的量产表现将是关键检验。

综合科创板日报、财联社、快科技报道 | 2026年9月2日