🎯 人工智能 · AI安全
一、最强模型触碰到安全红线🔥 OpenAI最强模型Astra因"循环深度"技术引发不可监控争议,首席科学家首次出面澄清
当地时间9月2日,OpenAI发布最新技术博客宣布,其下一代模型Astra已触及公司内部"准备框架"最高级别的"关键"网络安全能力阈值,成为该公司迄今能力最强、安全管控最严格的模型。然而,同一份技术文档中关于"循环深度"(Recurrent Depth)推理技术的披露,却在全球AI安全界引发了剧烈震动。
Astra能够自主发现此前未知的安全漏洞,并进一步开发漏洞利用方案,其网络安全能力较前代GPT-5.6 Sol实现显著提升。更引人注目的是,OpenAI CEO山姆·阿尔特曼近期在播客中透露,Astra在操作电脑方面"感觉已经完全达到了人类水平",并判断AGI的到来"至少已经非常接近了"。
Astra不仅是OpenAI迄今最强模型,更首次触碰了公司安全框架的最高风险等级——这意味着其一旦被滥用,可能产生前所未有的安全威胁。
二、"不透明循环"引发安全界恐慌争议的核心在于Astra采用的循环深度推理技术。该模式下,同一组Transformer层被反复计算,部分推理过程发生在模型内部,不必全部以思维链形式呈现,因此也被称为"不透明循环"。当计算图深度拉得极高时,模型可以在内部隐式完成海量推理步骤,而人类无法查看其中间思考过程,导致安全审计与思维链监控全部失效。
AI安全界反应极为强烈。非营利AI安全组织Redwood Research首席执行官巴克·施莱格里斯发文称"极度担忧",他结合此前OpenAI模型攻击Hugging Face社区事件表示:"如果进一步推进循环深度技术,将彻底破坏思维链的可监测性,这着实令人恐惧。"曾参与调查该安全事件的Redwood Research首席科学家瑞安·格林布拉特更直言,这可能是"迄今为止AI安全最严重的一次倒退"。
三、首席科学家首次出面回应面对舆论风暴,OpenAI首席科学家雅库布·帕乔基于9月2日在社交平台发文回应。他承认思维链监控确实脆弱且正朝着更困难的方向发展,但强调这并非由架构变更导致。帕乔基透露,包括Astra在内的前沿模型,计算图深度与GPT-4相差不超过两倍,模型架构并未如外界担忧的那样出现跳跃式复杂度增长。
他同时表示,OpenAI自首批推理模型一直致力于维护和利用思维链监控技术,加强思维链监控仍是当前研究项目的核心目标。帕乔基还希望避免因信息失实引发一场冲向不可监控状态的军备竞赛——各大实验室竞相开发能力过强、人类难以监控的模型。
Astra的网络安全能力将仅向有限范围的测试人员开放,并通过旗下网络安全联盟Daybreak Blue逐步扩大访问权限。这篇回应虽暂时平息了部分质疑,但AI安全界对"循环深度"技术的担忧并未消退,一场关于AI能力与可控性边界的大讨论才刚刚开始。
综合第一财经、华尔街见闻报道 | 2026年9月3日