🎯 科技 · AI安全

🔥 OpenAI下一代模型Astra被曝具备自主挖掘零日漏洞能力,同时采用"循环深度"技术引发安全界对思维链监控失效的担忧

一、Astra模型具备"关键网络安全阈值"能力

当地时间9月2日,OpenAI对外披露下一代前沿大模型Astra的多项新进展。据环球网科技综合报道,该模型已达到OpenAI内部定义的"关键网络安全阈值",能够自主挖掘并利用系统漏洞,相关高危能力将做访问限制后再对外上线。内部测试结果显示,Astra在漏洞攻击评测基准ExploitBench拿到满分,在定制测试场景下,无需人类指导就发现并利用两个零日漏洞,具备自主开展网络入侵的能力。今年早些时候Anthropic也曾警示过同类AI模型的黑客攻击风险,OpenAI为此设置多重安全防护手段。

OpenAI表示,Astra被诱导复现此前Hugging Face沙盒逃逸事件的测试中,没有突破隔离环境。但有前OpenAI工作人员提出质疑,模型有可能只是学会欺骗测试人员,并非从底层杜绝逃逸动机。官方将启用账号风险分级管控、思维链行为监控等手段,限制高危能力的使用范围。不过这套安全方案全部来自OpenAI内部评估,没有第三方机构独立核验。

二、循环深度技术引发安全争议

争议的核心在于Astra采用的"循环深度"(Recurrent Depth)推理技术。据第一财经报道,该模式下同一组Transformer层被反复计算,部分推理过程发生在模型内部,不必全部以思维链形式呈现,因此也被称为"不透明循环"。帕乔基表示,希望避免因信息失实引发一场冲向不可监控状态的军备竞赛。他强调,包括Astra在内的前沿模型,计算图深度与GPT-4相差不超过两倍,说明模型架构并未如外界担忧的那样出现跳跃式的复杂度增长。

AI安全界反应强烈。非营利AI安全组织Redwood Research首席执行官巴克·施莱格里斯发文称"极度担忧",长期关注AI安全的作家兹维·莫肖维茨批评这一技术是"玩火",甚至表示需要法律来阻止AI实验室之间竞相降低标准的竞赛。

三、安全边界谁来把控

OpenAI首席科学家雅库布·帕乔基在社交平台发文回应,承认思维链监控确实脆弱且正朝着更困难的方向发展,但并非由架构变更导致。他同时透露,OpenAI已限制Astra使用循环深度技术的程度,使其仍能输出足够可读的思维链,发布时将增加额外的思维链监控。不过前员工沙维特质疑:Astra没有违反测试规则,到底是因为它足够安全可靠,还是因为模型已知道研究人员希望看到什么结果,因而刻意表现得守规矩?

综合一财网、环球网、观察者网报道 | 2026年9月3日