#首批GPT-6内测结果离谱#
#首批GPT-6内测结果离谱# OpenAI AGI叙事遭遇现实打脸
北京时间9月4日凌晨,OpenAI正式发布GPT-6 Astra,自称全球最智能对齐程度最高的模型,总裁布洛克曼更是直接喊出欢迎来到AGI时代。然而第三方独立评测和提前内测的开发者反馈却泼了一盆冷水——GPT-6并非官方宣传的代际碾压,其综合智能评分甚至落后于竞品。
官方吹上天实测被打脸。OpenAI官方数据显示Astra在FrontierMath Tier 4上得分97.6%,ARC-AGI-3达到99.9%,看似碾压一切。但独立评测机构Artificial Analysis的Intelligence Index v4.1.1给出了完全不同的结果:Astra max仅61分,与GPT-5.6 Sol持平,反而低于Anthropic Claude Fable 5.1的66分。
更离谱的是数据含金量问题。ARC-AGI-3的99.9%成绩是在OpenAI自有Provider Adapter配置下取得的,换到标准测试框架后得分骤降至62.7%。而号称最难数学基准之一的FrontierMath,其开发方Epoch AI承认OpenAI资助了该基准开发,并对部分题目拥有独占访问权——这相当于出题人兼考生,分数还能信几分?
开发者反馈环境操作强但智能没突破。提前获得内测资格的开发者反映,Astra并非在智能上遥遥领先,而是靠环境理解和操作能力弥补了短板。简单来说GPT-6不是一个更聪明的AI,而是一个更会动手的AI——它能更好地操控电脑界面操作软件完成任务流程,但在纯逻辑推理创意写作综合知识等维度上并没有拉开代际差距。
这与OpenAI AGI时代开启的叙事形成了微妙反差。如果AGI的定义是在所有认知任务上超越人类,那GPT-6显然还没到那个程度;但如果AGI的定义是能像人一样操作电脑完成任务,那Astra确实迈出了一大步。
AI竞赛进入精细化时代。回顾近期大模型发布节奏,Anthropic的Claude Fable 5.1谷歌的Gemini 3.8 Flash Muse的Spark 1.3,再加上OpenAI的GPT-6 Astra,头部厂商密集上新,竞争已从谁分高转向谁能用。
Astra的优势集中在计算机操作自动化工作流网络安全等特定领域,而在综合知识创意写作等维度并未拉开差距。这意味着大模型竞争正在向精细化场景化方向深化——没有一家厂商能在所有赛道保持绝对领先,各有所长各有所短。
OpenAI需要一张足够硬的牌来证明自己全球最智能的叙事,但GPT-6的内测结果提醒我们:AGI时代或许真的来了,但来的方式可能和宣传的不太一样。