🎯 科技 · AI大模型

🔥 核心观点:GPT-6 Astra在ARC-AGI-3测试中从7.8%跃升至99.9%接近满分,Brockman称这是AGI时代的开始,但奥特曼降温称AGI是营销术语

一、性能飞跃:FrontierMath 97.6%、ARC-AGI-3从7.8%到99.9%

9月3日,OpenAI正式发布GPT-6 Astra,并将其定位为"目前全球最智能、且对齐程度最高的模型"。从已公布的评测数据来看,Astra在多个核心基准测试中实现了代际飞跃:在代表高阶数学能力的FrontierMath Tier 4上,Astra得分达到97.6%;在强调陌生环境学习和抽象推理的ARC-AGI-3上,成绩从GPT-5.6 Sol的7.8%飙升至99.9%,几乎接近满分。

Astra是OpenAI迄今规模最大的训练项目,管理层确认使用了超过10万张GPU进行预训练。这一规模远超此前任何一代模型的训练投入,也标志着AI算力军备竞赛进入了一个新的量级。OpenAI的应用场景也从纯文本生成扩展到税务准备、游戏开发、建筑渲染、法律备忘录格式编排等更广泛的领域。

二、AGI之争:Brockman宣告时代到来,奥特曼谨慎降温

Astra发布后,OpenAI内部出现了微妙分歧。总裁兼联合创始人格雷格·布罗克曼在发布会上明确表示,Astra代表着"一代人的飞跃",并称未来回看这一阶段时,人们可能会把它视为AGI(通用人工智能)时代的开始。当被直接问及Astra是否符合AGI定义时,布罗克曼回应:"我认为这可能就是那个模型。"

然而,OpenAI创始人兼CEO山姆·奥特曼对此持更加谨慎的态度。他在私下场合将AGI称为"营销术语",暗示公司并不急于给模型贴上AGI标签。这种公开场合与私下表态的差异,引发了业界对OpenAI战略方向的热议。高盛Delta-One交易台主管Rich Privorotsky在周末研报中指出,市场真正兴奋的点在于:一款领先的大模型已真正脱颖而出——这正是AI牛市论调一直期待的情况。

三、安全争议:首个达到网络安全关键阈值的模型,能力与风险并存

Astra的能力跃升也带来了新的安全挑战。OpenAI公开的安全技术文档显示,Astra是公司首个达到《防范准备框架》关键网络安全能力阈值的模型。这意味着Astra具备了直接操作电脑、执行复杂网络任务的能力,同时也意味着如果被恶意使用,可能造成更大危害。

为此,OpenAI没有向所有用户开放Astra的全部能力,而是首先向受信任的网络安全组织开放,并针对高级网络安全任务设置了访问限制。这一策略既体现了公司对安全的重视,也引发了关于AI能力开放边界的讨论:如何在推动技术进步与防范滥用风险之间找到平衡,将成为整个AI行业持续面临的难题。

综合第一财经、财联社、界面新闻等报道 | 2026年9月7日