🎯 科技 · AI前沿
一、Astra模型:性能飞跃与安全隐忧并存🔥 OpenAI最强模型Astra即将发布,却因"不可监控"引发安全界集体担忧,首席科学家紧急回应
9月2日,OpenAI宣布其下一代前沿大模型Astra首次触及公司内部"准备框架"中最高级别的"关键"网络安全能力阈值。这是OpenAI迄今能力最强的模型,能够自主发现此前未知的安全漏洞,并进一步开发漏洞利用方案。在漏洞攻击评测基准ExploitBench上,Astra拿到满分,在定制测试场景下无需人类指导就发现并利用两个零日漏洞。
更引人关注的是,Astra搭载了一项名为"循环深度"(Recurrent Depth)的推理技术。该模式下,同一组Transformer层被反复计算,部分推理过程发生在模型内部,不必全部以思维链形式呈现,因此也被称作"不透明循环"。这意味着模型可以在不输出完整思维链的情况下完成深度推理,从而削弱了现有的安全审查机制。
部分研究人员认为,Astra在编码和计算机使用能力上的提升,可能堪比2023年GPT-4发布时的跨越式飞跃。OpenAI CEO奥特曼近期在播客中表示,Astra在操作电脑方面"感觉已经完全达到了人类水平",并透露AGI的到来"至少已经非常接近了"。
二、安全界集体发声:这是AI安全最严重的倒退?Astra的技术细节披露后,AI安全界反应强烈。非营利AI安全组织Redwood Research首席执行官巴克·施莱格里斯发文称"极度担忧",他表示如果不完整输出思维链,调查人员将无法查看模型的中间推理过程,安全事件调查将变得更加困难。曾参与调查Hugging Face安全事件的Redwood Research首席科学家瑞安·格林布拉特更是直言,这可能是迄今为止AI安全最严重的一次倒退。长期关注AI安全的作家兹维·莫肖维茨则批评这一技术是"玩火",甚至表示需要法律来阻止AI实验室之间竞相降低标准的竞赛。
三、首席科学家紧急回应:数据透明度至关重要面对业界的强烈质疑,OpenAI首席科学家雅库布·帕乔基于9月2日在社交平台发文回应。他承认思维链监控确实脆弱,且正朝着更困难的方向发展,但强调并非由架构变更导致。帕乔基表示,OpenAI自首批推理模型一直致力于维护和利用思维链监控,并认为该技术有助于观察模型对齐能力如何从训练分布中泛化,加强思维链监控仍是公司的重要承诺。
他同时强调,包括Astra在内的前沿模型,计算图深度与GPT-4相差不超过两倍,说明模型架构并未如外界担忧的那样出现跳跃式的复杂度增长。OpenAI表示,Astra最先进的网络安全能力将仅向有限范围的测试人员开放,随后通过旗下网络安全联盟Daybreak Blue逐步扩大访问权限。官方还将启用账号风险分级管控、思维链行为监控等手段限制高危能力的使用范围。但需要注意的是,这套安全方案全部来自OpenAI内部评估,没有第三方机构独立核验。
综合第一财经、华尔街见闻、环球网报道 | 2026年9月3日