🎯 科技 · AI模型

🔥 OpenAI发布GPT-6 Astra,10万GPU训练,网安能力首达关键级,总裁宣告欢迎来到AGI时代

一、代际跃迁:从聊天机器人到数字员工

美东时间9月3日,OpenAI正式发布新一代旗舰模型GPT-6 Astra,并将其称为一次代际跃迁。OpenAI总裁Greg Brockman表示,Astra标志着人们可以委托给AI的工作类型以及AI赋能方式的一次真正转变。

与以往模型不同,Astra的核心变化在于能够直接操作计算机和软件,替用户完成编程、科学研究、金融建模、制作演示文稿和电子表格等复杂任务。OpenAI展示的能力包括:在软件环境中制作电子表格和演示文稿、进行金融建模、搭建3D环境、设计电路板,以及处理报税表等复杂工作。模型尤其擅长操作计算机,可以根据用户提出的目标,自主完成一系列此前需要人类在不同软件之间切换、执行的步骤。

这意味着AI竞争的衡量标准正在发生变化:从模型能否生成更好的文字、代码和图片,逐渐转向模型能否独立完成一项完整工作。

二、benchmark全面领先,数学与网安能力突破

从评测结果来看,Astra在多项基准测试中取得突破性成绩。在代表高阶数学能力的FrontierMath Tier 4上,Astra得分达到97.6%,几乎将这套研究级数学测试打穿;在强调陌生环境学习和抽象推理的ARC-AGI-3上,其成绩更是从GPT-5.6 Sol的7.8%跃升至99.9%,接近满分。

相比数学和抽象推理,Astra在网络安全上的跃升更具现实冲击力。在测试漏洞利用能力的ExploitBench中,Astra得分达到100%,而GPT-5.6 Sol为78.5%;在专门使用2026年6月至8月新漏洞构建的测试中,Astra的成功率达到39%,远高于Sol的5.5%。Astra是OpenAI首个达到内部关键网络安全能力门槛的模型,意味着它已经具备发现此前未知漏洞、开发漏洞利用程序的能力。

出于安全考虑,OpenAI对其最先进的网络安全能力设置了更严格的访问限制,初期只向经过筛选的测试群体开放。

三、对齐程度创新高,计算机操作能力大幅提升

除了更强,Astra也更听话。它是OpenAI迄今对齐程度最高的模型,在理解用户意图和约束自身行为方面均取得显著进步。OpenAI参考近期的Hugging Face事件设计了一项新的评估,用以测试当模型面对极其困难、甚至无法完成的任务时,是否会为了达成目标而擅自突破用户授权边界。在没有生产环境安全措施的情况下,GPT-5.6 Sol有48%的情况会超出授权目标,而GPT-6 Astra的这一比例为0%。

在计算机操作能力方面,Astra同样实现明显跃升。其在Agents Last Exam上得分59.3%,在ScreenSpot-Pro上达到92.7%,在AutomationBench上达到41.4%,均高于公告中列出的主要对比模型。OpenAI表示,Astra操作计算机的能力可见于各领域的输出,包括但不限于将电子原理图转化为可制造的PCB、以约为人类冠军选手四倍的速度完成金融建模世界杯挑战、使用Unity进行游戏场景建模等。

综合华尔街见闻、财联社、第一财经报道 | 2026年9月4日