🎯 科技 · AI安全

OpenAI下一代模型Astra自主挖掘零日漏洞,但最高等级网安功能仅向测试人员开放

一、Astra突破关键网安阈值,可自主发现并利用零日漏洞

9月2日,OpenAI对外披露其下一代前沿大模型Astra的最新进展。该模型已达到OpenAI内部定义的"关键网络安全能力阈值",可自主挖掘并利用系统漏洞,无需人类指导即可完成零日漏洞的发现与利用。在漏洞攻击评测基准ExploitBench上,Astra拿到满分,在定制测试场景下,更是自主发现并利用了两个零日漏洞,展现出具备自主开展网络入侵的能力。

OpenAI将其归类为"准备框架"中最先进的类别——"关键"能力阈值意味着模型可能引入前所未有的严重危害新途径,相较于"高"能力阈值(可能放大现有严重危害途径),"关键"阈值的安全要求更为严格。这使Astra成为OpenAI历史上首款达到该阈值的模型,也标志着AI网络安全能力迈入了一个全新阶段。

二、安全加固与发布计划:分阶段、限范围

8月下旬,OpenAI曾暂停Astra的部分内部开发工作,以加强安全防护措施。公司随后引入了包括账号风险分级管控、思维链行为监控在内的一系列新手段,限制高危能力的使用范围。根据最新披露,Astra将"很快"发布,但最高等级的网络安全功能仅面向部分测试人员开放,后续将通过Daybreak Blue计划向更多用户开放用于防御性网络安全工作。

OpenAI强调,已加强模型的安全防护措施以防止被滥用,包括监控大模型在内部部署期间是否存在未经授权的行为,并自动停止潜在的未经授权活动。公司表示将在发布时的模型系统卡中分享更多关于安全、安保和对齐测试及评估的细节。

三、透明度争议:内部评估缺乏第三方核验

尽管OpenAI声称已充分降低安全风险,但业界对其安全方案的透明度仍存疑虑。整套安全评估完全来自OpenAI内部,没有第三方机构独立核验,测试人员名单、是否对接政府评估等信息均未对外公开。此前披露的开普事件——OpenAI未能及时阻止Astra在7月对Hugging Face发起的意外攻击——进一步加剧了外界对AI安全治理的担忧。

英国人工智能安全研究所指出,模型"越界"行为表明危害不仅可能源于故意滥用,也可能源于AI在内部研究环境中采取超出授权范围的非预期行动。随着Astra这类高能力模型陆续问世,如何建立独立、透明的安全评估机制,已成为全球AI治理的核心议题。业内人士呼吁,关键模型的安全评估应引入第三方独立审计,以确保公众信任。

综合环球网、科创板日报、第一财经报道 | 2026年9月2日