🎯 科技 · AI安全

🔥 OpenAI下一代模型Astra采用"循环深度"技术,允许不输出完整思维链,引发AI安全界"不可监控"担忧

一、"不透明循环"引发安全焦虑

9月2日,OpenAI首席科学家雅库布·帕乔基在社交平台发文回应围绕新模型Astra的争议。这场风波源于此前一天披露的消息:Astra采用了名为循环深度(Recurrent Depth)的推理技术,同一组Transformer层被反复计算,部分推理过程发生在模型内部,不必全部以思维链形式呈现。

这项技术被业界称为"不透明循环"——模型可以在输出下一个词元前增加内部推理深度,而非仅依赖更长的可见文本思维链。这意味着研究人员可能无法像以往那样有效监控模型的推理过程,安全审计和思维链监控面临失效风险。

不过帕乔基强调,包括Astra在内的前沿模型,计算图深度与GPT-4相差不超过两倍,模型架构并未出现跳跃式的复杂度增长。他同时承认思维链监控确实脆弱,但加强监控仍是OpenAI研究的核心目标。

二、AI安全界反应强烈

消息披露后,AI安全领域反应激烈。非营利AI安全组织Redwood Research首席执行官巴克·施莱格里斯发文称"极度担忧",他指出如果进一步推这项技术、大幅增加循环次数,将彻底破坏思维链的可监测性。

曾参与调查Hugging Face安全事件的Redwood Research首席科学家瑞安·格林布拉特表示,这可能是迄今为止AI安全最严重的一次倒退。长期关注AI安全的作家兹维·莫肖维茨则批评这一技术是"玩火",甚至表示需要法律来阻止AI实验室之间竞相降低安全标准的竞赛。

需要指出的是,Astra虽然未参与此前的Hugging Face入侵事件,OpenAI仍主动暂停了部分相关开发工作,并将此次事件的经验教训纳入了Astra的安全体系。OpenAI已将Astra的网络安全能力评定为最高级别的"关键"门槛。

三、性能飞跃与安全权衡

据The Information报道,Astra在编码和计算机使用能力上的提升,可能堪比OpenAI 2023年发布GPT-4时带来的性能飞跃。其核心突破在于:通过将问题反复传递至模型各"层"进行循环处理,模型能在不显著增加参数规模的情况下,展现出远超自身体量的推理能力。

OpenAI CEO奥特曼近期透露,Astra在操作电脑方面"感觉已经完全达到了人类水平",并认为AGI的到来"至少已经非常接近了"。

Astra将在网络安全能力上仅向有限范围的测试人员开放,随后通过旗下网络安全联盟Daybreak Blue逐步扩大访问权限。这场性能与安全之间的博弈,才刚刚开始。

综合第一财经、华尔街见闻、观察者网报道 | 2026年9月3日