🎯 科技 · AI大模型

🔥 核心观点:GPT-6 Astra不仅是性能跃迁,更是AI从"聊天工具"迈向"数字员工"的分水岭

一、AGI时代正式开启?

美东时间9月3日,OpenAI正式发布新一代旗舰模型GPT-6 Astra,并宣告"欢迎进入AGI时代"。OpenAI总裁Greg Brockman在发布会上表示,人们未来或许会回头将这个模型视为人工通用智能到来的标志性节点。这并非盲目乐观——Astra在多个基准测试中展现出的能力,确实让人看到了质变的痕迹。

10万块GPU、得州Stargate基地、10万训练算力的庞大投入,构筑了Astra性能跃升的底座。在数学测试Math Tier 4上,Astra得分97.6%;在强调抽象推理的ARC-AGI-3上,成绩从GPT-5.6 Sol的7.8%跃升至99.9%,几乎满分。

但真正让人震撼的,是Astra在网络安全领域的突破。在ExploitBench测试中,Astra得分达到100%,而GPT-5.6 Sol仅为78.5%;使用2026年6月至8月新漏洞构建的测试中,Astra成功率39%,远超Sol的5.5%。这意味着Astra首次达到OpenAI内部"关键"网络安全能力门槛,已经具备发现未知漏洞、开发漏洞利用程序的能力。

二、从聊天机器人到数字员工

Astra的核心变化,是AI开始从"提供答案"转向"完成任务"。OpenAI展示的能力包括:在软件环境中制作电子表格和演示文稿、进行金融建模、搭建3D环境、设计电路板,甚至处理报税表等复杂工作。

Astra能够在真实的软件环境中执行任务,用户不再需要把一个复杂目标拆成几十个指令,而是可以直接提出最终目标,由模型自行完成更多中间步骤。在Agents' Last Exam上得分59.3%,ScreenSpot-Pro上达到92.7%,AutomationBench上达到41.4%,均高于主要对比模型。

计算机操作能力的跃升,让AI竞争的衡量标准正在发生变化:从模型能否生成更好的文字、代码和图片,逐渐转向模型能否独立完成一项完整工作。

三、安全争议与开放边界

网络安全能力的突破也带来了新的担忧。OpenAI承认,Astra在一些任务中能够以更少的可见推理步骤解决问题,"思维链"的可监测性面临挑战。为此,OpenAI对最先进的网络安全能力设置了更严格的访问限制,通过Daybreak计划先向筛选组织提供更先进能力,同时在面向普通用户的版本中增加安全防护。

对于多数ChatGPT用户而言,Astra将在"未来数日内"正式推出,Pro版本仅面向付费用户开放。无论如何,AGI时代的帷幕,正在被缓缓拉开。

综合华尔街见闻、财联社、一财网报道 | 2026年9月4日