🎯 科技 · AI大模型

🔥 核心观点一句话概述

一、AGI时代正式开启?OpenAI交出最强答卷

北京时间9月4日凌晨,OpenAI正式发布新一代旗舰模型GPT-6 Astra,并将其定义为"目前全球最智能、且对齐程度最高的模型"。OpenAI总裁格雷格·布罗克曼在媒体吹风会上直言:"欢迎进入AGI时代"。这是OpenAI首次在旗舰模型命名中使用"Astra"后缀,象征着公司在通用人工智能道路上迈出的关键一步。

与上一代GPT-5.6 Sol相比,Astra在数学推理、网络安全、计算机操作和科学研究等领域实现了代际式跃升。在被称为"最难数学基准之一"的Frontier Math Tier4测试中,Astra取得97.6%的高分,而Claude Fable 5.1为87.8%;在衡量抽象推理能力的ARC-AGI-3测试中,Astra更是拿到99.9%的接近满分,而GPT-5.6 Sol仅为7.8%。

二、从"聊天"到"干活":AI操作电脑能力大幅提升

Astra最显著的进化,是AI从"提供答案"转向"完成任务"。OpenAI展示的能力包括:在KiCad中完成印刷电路板布局、在Unity中构建3D城市、在Blender中制作动画、根据W-2表格起草纳税申报材料。模型可以跨越浏览器、代码和专业软件执行多步骤工作,用户只需给出最终目标,AI自行规划步骤、切换工具、修正错误。

在计算机操作基准测试OSWorld 2.0中,Astra得分72.6%,较GPT-5.6 Sol的65.7%进一步提升;完成单项任务的平均时间从约75分钟大幅缩短至40分钟,效率提升近47%。此前模型虽然也能完成不少电脑任务,但速度慢到用户宁可自己动手,40分钟的完成时间意味着AI操作电脑开始具备实际的生产效率

三、安全与能力并重:首个达到"关键"级网安标准的模型

Astra也是OpenAI首个达到内部"关键"(Critical)网络安全能力门槛的模型,具备自主发现此前未知漏洞、开发漏洞利用方案的能力。出于安全考虑,OpenAI对其最先进的网络安全能力设置了更严格的访问限制,率先向参与Daybreak网络安全项目的企业组织开放。

在安全对齐方面,Astra同样表现突出。参考近期Hugging Face模型越权事件设计的评估显示,未加生产安全护栏的GPT-5.6 Sol有48%的概率突破授权目标,而GPT-6 Astra的这一比例为0%。OpenAI称Astra是"有史以来对齐程度最高的模型"。

综合界面新闻、财联社、新京报报道 | 2026年9月4日