🎯 科技 · AI

🔥 OpenAI高调宣布AGI时代来临,但99.9%和62.7%两份成绩单"打架",AGI是技术跃迁还是营销造势?

一、99.9% vs 62.7%,同一模型两份成绩单

当地时间9月3日,OpenAI正式发布新一代旗舰模型GPT-6 Astra,并宣称这是公司迄今"最智能、最对齐"的模型。OpenAI总裁格雷格·布罗克曼随即高调宣布:"欢迎来到AGI时代"。宣布的依据是,GPT-6 Astra在AI通用学习能力测试ARC-AGI-3中斩获99.9%的最高分,在ExploitBench(漏洞利用程序构造)测试中达到100%,在 FrontierMath Tier 4 v2(高难度数学推理)中正确率达97.6%。

然而,同一模型在第三方统一测试环境下的表现却打了六折。在Artificial Analysis的最新智能指数中,GPT-6 Astra最高推理档仅拿到61分,与上一代GPT-5.6 Sol持平,排名第5,低于Claude Fable 5.1最高档的66分。更关键的是,99.9%的"满分"成绩是在OpenAI自有测试环境中取得的,而换成统一测试环境后得分骤降至62.7%。这一巨大落差让外界对"AGI"的定义再次产生质疑。

二、AGI定义11年变5次,奥尔特曼刚说"营销术语"

过去11年,OpenAI内部对AGI的定义已经反复变化了至少5次。每次有新模型发布,OpenAI都会重新界定"通用人工智能"的门槛。而讽刺的是,CEO山姆·奥尔特曼在几天前刚刚公开表示,AGI是一个"营销术语"。如今转头就高调宣布"AGI时代到来",这种自相矛盾让不少分析人士认为,OpenAI此举更多是出于商业考量而非技术里程碑。

背景是,OpenAI正面临来自Anthropic的全面挑战。据路透社报道,Anthropic据悉已接近敲定150亿美元的上市前信贷安排,摩根士丹利牵头,高盛、摩根大通和花旗参与。这意味着Anthropic的IPO进程可能领先于OpenAI。在收入、估值和上市速度都被对手超越的压力下,OpenAI此时拉响AGI信号弹,究竟是技术跃迁的宣言,还是在资本市场竞赛中的营销战术?值得持续关注。

三、真实能力:Agent性能提升显著,但分化明显

抛开AGI标签,GPT-6 Astra的真实能力提升确实不容忽视。在科研工��测试Terminal-Bench Science 0.1中,得分从GPT-5.6 Sol的22.4%飙升至64.6%,接近三倍提升。电脑操作能力测试ScreenSpot-Pro从76.9%提高到92.7%,OSWorld 2.0达到72.6%。更值得注意的是,完成一项任务的模拟平均时间从约75分钟缩短到40分钟,耗时减少了近一半。

用户实测也给出了积极反馈。有用户让GPT-6 Astra在虚幻引擎中搭建曼哈顿虚拟场景,整个任务持续了一周,模型能够沿着街道逐步补充建筑和环境细节,持续运行多天后仍能继续此前的进度完善场景。不过,OpenAI也警告称,这一模型的监控难度可能更高,正进一步加强安全"护栏"。分阶段发布的策略也引发了不满——优先向特定企业客户开放,其余Plus、Pro用户需等待"未来数天",奥尔特曼已在X平台致歉。

综合界面新闻、中新经纬、Artificial Analysis报道 | 2026年9月6日