🤖 AI科技 · AI大模型

🔥 GPT-6 Astra官方宣称AGI时代已来,但在第三方权威评测中却表现平平,排名第5低于Claude,"AGI"成色待考。

一、官方吹爆,第三方打脸

9月4日凌晨,OpenAI正式发布GPT-6 Astra,CEO山姆·奥特曼称其为"目前全球最智能、对齐程度最高的大模型",总裁布洛克曼更是直言"欢迎来到AGI时代"。然而,第三方评测机构Artificial Analysis的最新智能指数却给了这记高调发布一盆冷水。

在Artificial Analysis智能指数4.1.1的评测中,GPT-6 Astra最高推理档仅拿到61分,排名第5,低于Claude Fable 5.1的66分,也低于Claude Opus 5的63.1分。更令人意外的是,在独立机构建立的Standard Harness环境中,GPT-6 Astra的得分仅为62.7%,与其官方宣传的"接近满分"相去甚远。

此前有观点认为AGI的关键在于系统面对陌生任务时以多高效率获得新技能的能力,而测试机构Standard Harness正是基于此理念设计,要求模型在统一环境下解决ARC-AGI-3测试。在此标准下,GPT-6 Astra的表现确实打了六折。

二、Agent能力突破,但"AGI"成色不足

尽管综合排名不算耀眼,但GPT-6 Astra在特定领域确实有显著进步。在科研工作流测试Terminal-Bench Science 0.1中,其得分从GPT-5.6 Sol的22.4%跃升至64.6%,接近上一代的三倍。ScreenSpot-Pro从76.9%提高到92.7%,意味着在电脑操作和界面理解上更加实用。

实测中,有用户让GPT-6 Astra在虚幻引擎中搭建曼哈顿虚拟场景,持续运行一周后仍能继续此前进度;Codex团队测试其3D建模能力时,模型根据平面图在Blender中完成建模并转入Unreal Engine生成可实时行走的3D空间,表现相当出色。这些能力跃升,是Astra相较于前代最核心的增量。

但AGI不是单项冠军,而是通用智能。当Astra面对不同测试标准时成绩波动明显,说明其在泛化能力和跨领域适应上仍有明显短板。奥特曼口中国"AGI时代"的宣告,或许更像一次精心策划的营销,而非技术成熟度的客观认定。

三、AGI定义反复修改,信任透支成隐患

回顾OpenAI近年对AGI的定义,2018年是"在大多数经济价值工作上超过人类",2023年变为"总体上比人类更聪明",2024年微软要求1000亿美元利润门槛,再到后来取消这一合同安排——AGI的定义在OpenAI内部不断被调整。

"AGI"已经从技术概念演变为营销术语。当同一个模型在不同测试环境中得分相差近一倍,当官方评分与第三方评测相差甚远,行业对"AGI"一词的信任正在被透支。真正的通用智能,需要经得起多重独立测试的检验,而非一次发布会上的豪言壮语。

综合新浪财经、澎湃新闻、每日经济新闻、科技日报报道 | 2026年9月5日