🎯 科技 · AI大模型
一、断层式领先,评测数据震撼业界🔥 GPT-6 Astra横空出世,多项评测逼近满分,OpenAI总裁宣布"欢迎来到AGI时代"
北京时间9月4日凌晨,OpenAI正式发布新一代旗舰模型GPT-6 Astra,官方将其定义为"目前全球最智能且对齐程度最高的模型"。ARC-AGI-3测试中,Astra得分从上一代GPT-5.6 Sol的7.8%跃升至99.9%,短短一代模型实现了超过十二倍的提升;在被称为"最难数学基准之一"的FrontierMath Tier 4中,Astra拿下97.6%的高分,几乎将这套研究级数学测试"打穿",甚至帮助解决了素数间隔研究中悬而未决80多年的开放性难题。
在网络安全漏洞利用测试ExploitBench中,Astra斩获100%满分,远超上一代的78.5%。更令人瞩目的是,Astra首次达到OpenAI内部"关键级"网络安全能力门槛,能够在较少人类干预下自主发现未知漏洞并开发利用方案。OpenAI总裁格雷格·布洛克曼在发布会上掷地有声:"欢迎进入AGI时代。"
二、从"回答问题"到"替你干活"Astra最核心的突破在于Computer Use能力的全面成熟——它不再局限于对话框内的文字生成,而是能够像人类一样直接操作屏幕、鼠标和键盘,自主完成跨软件、多步骤的复杂工作流。在官方演示中,Astra独立完成填写报税表、更新CRM客户记录、整理日程安排、使用Power BI制作财务报表、甚至在KiCad中进行PCB电路布局。
在OSWorld 2.0自动化工作流测试中,Astra完成任务平均仅需40分钟,较上一代的75分钟大幅缩短47%,这意味着AI操作电脑开始具备实际的生产效率。OpenAI CEO山姆·奥特曼表示,这是第一个让他觉得可以放心让用户直接"试一试"的模型。
三、安全与能力的双重博弈Astra的强大恰恰也是其最令人不安之处。作为首个达到"关键级"网络安全能力的模型,Astra能够在获得适当工具的情况下自主攻击防护严密的系统——而这套能力目前已向部分企业客户限量开放,普通用户还需等待数日。
但与此同时,Astra在行为约束上反而更加"守规矩":面对越界任务时擅自突破授权边界的比例从上一代的48%降至0%,不当行为率从22.0%降至2.4%,能力幻觉率从9.4%降至2.0%。这种"能力更强、行为更克制"的反差,正是当前AI安全对齐研究的最新方向。Astra的API定价为每百万输入token 10美元、输出50美元,约为上一代的2.5倍,AI正在从"按token计费的工具"向"按任务计费的雇员"转变。
综合新华网、科技日报、澎湃新闻、界面新闻、封面新闻报道 | 2026年9月5日