🎯 科技 · AI评测
一、Benchmark wars升级,GPT-6打出统治级数据🔥 GPT-6 Astra以99.9%的ARC-AGI-3满分成绩碾压前代,但定价翻2.5倍引发行业定价策略大辩论
9月3日,OpenAI正式发布GPT-6 Astra,被官方称为"地球最强大模型"。在独立评测平台Artificial Analysis的综合榜单中,Astra与Anthropic的Claude Fable 5.1并列第一,技术叙事从"碾压"转向"追平"。但真正让人震惊的是单项能力跃升——在代表通用推理能力的ARC-AGI-3测试中,Astra从GPT-5.6 Sol的7.8%飙升至99.9%近乎满分,这个数字差意味着模型从"偶尔能做"进化到"几乎必对"。
数学能力同样亮眼:FrontierMath Tier 4上Astra得分97.6%,远超GPT-5.6 Sol的83.0%和Claude Fable 5.1的87.8%。网络安全方面,ExploitBench漏洞利用测试中Astra拿下100%满分,而Sol仅为78.5%,使用2026年6-8月新漏洞构建的测试中成功率更是达到39%对5.5%的悬殊差距。
二、定价策略大分歧:OpenAI逆势涨价 vs Anthropic降价当性能追平时,两家的定价走向却南辕北辙。OpenAI没有延续旗舰模型持续降价的思路,将Astra的API单价定为前代的2.5倍——百万输入token 10美元、输出50美元,同时推出快速模式价格再翻倍。官方理由是Astra能用更少输出token完成复杂任务,实际任务成本反而更低,这标志着行业从"按量收费"向"按效果收费"的商业模式演进。
Anthropic选择相反路线:Fable 5.1基础单价不变,但将缓存读取价格从1美元/百万token骤降至0.25美元,降幅达75%,预计典型工作负载成本下降约25%,高度Agent化任务节省最高45%。这一策略直指企业客户为"额外智能"付费意愿接近上限的现实——当头部模型达到能力门槛后,性价比比Benchmark分数更重要。
三、算力军备竞赛升温,万亿估值前的关键一搏Astra的训练规模空前,在得克萨斯州Stargate基地动用超10万块GPU完成预训练,远超GPT-5.6 Sol。银河证券指出,这确立了算力壁垒,高速光互联产业链将持续受益。两家公司已秘密提交IPO申请冲击万亿美元估值,定价策略的分歧直指大模型商业化的核心命题:在性能追平而非碾压的节点,"更贵但更强"的溢价叙事能否成立,将决定谁能把模型能力真正兑现为持续收入。
综合蓝鲸新闻、华尔街见闻、智通财经报道 | 2026年9月9日