?? · AI

GPT-6性能追平Claude却逆势提价2.5倍,AA V4.2评分标准背后的定价博弈

9月9日消息,AI评测机构AA(Artificial Analysis)正式推出V4.2评分标准,对各大旗舰模型的竞技能力、可靠性、代码能力和成本效率进行综合评估。根据最新榜单,OpenAI的GPT-6 Astra与Anthropic的Claude Fable 5.1并列第一,重新追平技术叙事。GPT-6在代码生成和推理任务上优势明显,在AA综合评分中首次超过Muse Spark 1.3。

性能不分伯仲,但定价策略却走向两极。GPT-6 Astra没有延续此前旗舰模型的降价路线,而是将API单价定为前代GPT-5.6 Sol的2.5倍。OpenAI官方解释称,在部分评测中Astra能用更少输出token取得更好结果,估算每项任务的API成本反而更低——即所谓"按任务效果收费"的新模式。

与OpenAI的逆势提价形成鲜明对比,Anthropic选择的是以价换量策略。Claude Fable 5.1未调整基础单价,但把缓存读取价格降至0.25美元/百万token,较Fable 5下调75%。据Anthropic测算,这将使典型工作负载成本下降约25%,高度Agent化任务的成本最高下降45%。

两家公司的定价分歧,直指大模型商业化的核心命题:当技术性能趋于同质化时,企业更愿意为"效果付费"还是为"用量付费"?OpenAI押注前者,Anthropic押注后者。华尔街见闻分析认为,OpenAI的"按效果收费"模式若能跑通,将打破企业客户对Token计价的付费天花板,但前提是效果必须可量化、可验证。

GPT-6追平Claude却逆势提价2.5倍,这场定价博弈的结果,将决定谁能真正拿到企业级AI市场的入场券。

综合华尔街见闻、Artificial Analysis报道 | 2026年9月9日