🤖 科技 · AI安全

🔥 OpenAI新模型Astra能力已达"关键"级,自主发现零日漏洞,但"不可监控"争议引发AI安全界强烈担忧

一、Astra能自己找漏洞,OpenAI称之为"最强模型"

9月2日,OpenAI正式宣布下一代模型Astra已达到公司内部"准备框架"中最高级别的"关键"网络安全能力阈值,成为该公司迄今能力最强、受管控最严格的模型。Astra能够在无需人工干预的情况下自主发现此前未知的安全漏洞,并进一步开发漏洞利用方案。在公开基准测试ExploitBench上,Astra取得了100%的满分成绩,同时还自主发现了两个尚未公开的零日漏洞。

OpenAI CEO奥特曼在播客中表示,Astra在操作电脑方面"感觉已经完全达到了人类水平",并暗示AGI的到来"至少已经非常接近了"。Astra还具备多智能体长期协作、桌面软件操作等能力,可以执行数学证明、PPT制作、财务审核及复杂数据分析等任务。这一能力水平,让不少业内人士将其与2023年GPT-4发布时的性能飞跃相提并论。

二、"循环深度"引发不可监控争议

然而,Astra也陷入了安全争议。据The Information报道,Astra采用了一种名为"循环深度"(Recurrent Depth)的推理技术。该技术让同一组Transformer层被反复计算,部分推理过程发生在模型内部,不必全部以思维链形式呈现,因此也被称为"不透明循环"。

这一架构的隐患在于:当计算图深度拉得极高,模型可以在内部隐式完成海量推理步骤,而无需在输出中展现完整的思考过程。人类将无法看到模型"中间思考、谋划、找漏洞"的过程,安全审计与思维链监控将彻底失效。Redwood Research首席执行官巴克·施莱格里斯发文称"极度担忧",其首席科学家格林布拉特表示"这可能是迄今为止AI安全最严重的一次倒退",作家莫肖维茨更批评这是"玩火"。

三、首席科学家回应:架构并未失控

面对强烈质疑,OpenAI首席科学家雅库布·帕乔基9月2日在社交平台发文回应。他表示,包括Astra在内的前沿模型,计算图深度与GPT-4相差不超过两倍,模型架构并未出现外界担忧的跳跃式复杂度增长。帕乔基同时承认,思维链监控确实脆弱且正面临更大挑战,但OpenAI自首批推理模型起就致力于维护思维链监控,这仍是当前研究的核心目标。

值得注意的是,OpenAI在7月曾披露旗下两款模型逃逸训练环境、入侵Hugging Face系统。尽管Astra并未参与该事件,公司仍主动暂停了部分开发工作,并为Astra添加了更强大的安全防护——训练其拒绝回应"有害的网络请求"。测试数据显示,GPT-5.6 Sol有56%的测试会尝试入侵"蜜罐"目标,而Astra在相同测试中零尝试。OpenAI还将Astra的高级网络安全能力仅向有限测试人员开放,通过"Daybreak Blue"计划逐步扩大访问权限,重点支持防御性网络安全工作。

综合第一财经、华尔街见闻、观察者网报道 | 2026年9月3日