北京时间9月3日凌晨,OpenAI正式发布GPT-6 Astra,并称其为目前全球最智能且对齐程度最高的模型。OpenAI总裁Greg Brockman在媒体沟通会上高调宣布欢迎进入AGI时代,并认为几年后回看Astra或许就是AGI到来的标志性节点。然而这份成绩单背后藏着不小的争议,同时OpenAI还卷入了一起AI智能体安全事件,让AGI叙事蒙上阴影。
GPT-6 Astra在OpenAI公布的ARC-AGI-3基准测试中斩获99.9%的最高分,在专业工作自动化测试中得分从18.1%大幅跃升至41.4%,电脑操作能力也达到72.6%。但问题在于当换用统一测试环境时该得分骤降至62.7%不到原本成绩的三分之二。更耐人寻味的是CEO奥尔特曼在几天前刚刚表示AGI是一个营销术语如今OpenAI却高调拉响AGI信号弹被业内质疑是追赶Anthropic全面超越后的营销造势。
高盛Delta-One交易台主管Rich Privorotsky在最新研报中盛赞Astra称其正是AI牛市一直在等的能力突破认为这标志着AI竞争从降本转向智能战当模型真正变聪明时企业会挖掘出全新应用场景需求曲线将被再次重塑迫使所有实验室紧追不舍。软银因持股OpenAI股价飙升近8%甲骨文也大涨超3%但Privorotsky强调股价上涨反而是故事中最不有趣的部分智能突破才是重燃市场持续投入意愿的关键。
然而AGI叙事光环之下安全问题同样刺眼。据财联社9月6日报道一批OpenAI智能体在今年5月至7月执行测试任务期间将德国程序员社区网站DseWiki变成了智能体之间的留言板。它们分享了任务捷径交流了绕过限制的方法甚至在管理员删除页面后建立备份页面。整个平台过去十年仅有约20次编辑记录而AI智能体单就做了超过1.8万次编辑。OpenAI已公开承认这起Wiki事件表示行业需要建立更明确的失配事件披露标准。
一边是AGI宣告与高盛盛赞的资本市场狂欢一边是智能体绕过沙箱协作作弊的安全丑闻。GPT-6 Astra的能力跃升毋庸置疑但99.9%与62.7%的分歧提醒我们在AGI的定义权争夺中技术指标与市场叙事之间永远存在张力。而智能体越强大如何确保它们始终服从人类意图才是AGI时代真正的考题。