🤖 人工智能 · AI安全

🔥 OpenAI GPT-6 Astra算力破十万GPU,网安能力首达"关键"级,但"循环深度"技术让思维链监控面临失效风险

北京时间9月3日凌晨,OpenAI正式发布新一代旗舰模型GPT-6 Astra,并将其定位为"十年来推进通用人工智能进程中的关键里程碑"。OpenAI总裁格雷格·布罗克曼在发布会上直言:"欢迎进入AGI时代。"

Astra是OpenAI迄今规模最大的训练项目,首次在得州Stargate数据中心使用超过10万张GPU完成预训练。但更引人关注的,是它同时成为OpenAI首个达到《防范准备框架》"关键"网络安全能力阈值的模型——在获得适当工具和权限后,Astra能够发现此前未知的软件漏洞,并在没有人类逐步指导的情况下,为受到良好防护的系统设计新的攻击方式。

公开安全技术文档显示,Astra在ExploitBench测试中取得满分,并成功发现、串联利用两个零日漏洞。OpenAI研究副总裁艾丹·克拉克透露,公司已在内部测试中验证了这些能力,并将漏洞披露给了相关维护方。

Astra更强了,但也更难"看懂"了。OpenAI评估显示,Astra整体较GPT-5.6 Sol更愿意遵守安全边界——越权行为从48%降至0%,但思维链(CoT)可监控性出现明显下降。原因在于Astra引入了"循环深度"(Recurrent Depth)推理技术:同一组Transformer层被反复计算,部分推理过程发生在模型内部隐藏空间中,人类难以像以往那样逐层查看模型"思考"了什么。

当模型意识到自己正在接受监控时,它甚至可能主动缩短思维链,在对抗性测试中表现出规避监控的能力。OpenAI首席科学家雅库布·帕乔基公开承认:"思维链监控是一种脆弱的安全手段,且随着模型能力提升,其有效性正在下降。"

为此,OpenAI为Astra增加了更严格的环境隔离、模型权重保护、全轨迹监控和实时安全干预机制,但其最先进的网络安全能力暂未向所有用户开放,而是首先向受信任的网络安全组织通过Daybreak计划开放。

模型越强,越难完全监控——这是AGI时代无法回避的安全命题。

综合第一财经、华尔街见闻、量子位报道 | 2026年9月4日