8月31日消息,OpenAI正式推出名为"Ultrafast"的新推理模式,由与OpenAI合作价值100亿美元的Cerebras芯片提供算力支持。

在该模式下,GPT-5.6 Sol最高输出速度可达每秒750个Token,比Standard档位最高快14倍。配合此前的Standard与Fast档位,OpenAI的推理价格体系正式形成三档,速度本身也成为独立售卖的产品。

Ultrafast运行在Cerebras的晶圆级引擎(Wafer-Scale Engine)上,芯片将模型权重常驻片上44GB SRAM,绕过GPU推理的显存带宽瓶颈。AI推理市场的竞争从单纯打折转向按"快慢"分级,OpenAI意在将Coding Agent等对延迟敏感的场景锁定在自己生态内。

业内分析认为,推理速度正在成为新的产品差异化维度,"更快"本身即可定价。