🎯 科技 · AI安全

🔥 核心观点:OpenAI新一代Astra模型因"循环深度"技术引发安全争议,首席科学家帕乔基出面澄清,强调思维链监控仍是核心目标

一、Astra模型:性能飞跃还是安全倒退?

9月2日,OpenAI首席科学家雅库布·帕乔基(Jakub Pachocki)在社交平台发文,就新模型Astra引发的"不可监控"争议作出正式回应。这场争议源于Astra采用了一种名为"循环深度"(Recurrent Depth)的推理技术——同一组Transformer层被反复计算,部分推理过程发生在模型内部,不必全部以思维链形式呈现。

Astra的性能表现备受瞩目。据华尔街见闻报道,Astra在公开基准测试ExploitBench上取得100%满分成绩,自主发现了两个此前未知的"零日漏洞"。奥特曼更是在播客中透露,Astra操作电脑的能力"已完全达到人类水平",AGI的到来"至少已经非常接近了"。

Astra在网络安全测试中满分通关,自主发现两个零日漏洞,奥特曼称AGI已非常接近

二、"循环深度"技术:双刃剑引发安全界震动

循环深度技术的核心逻辑是:在输出下一个词元之前,模型可以在内部反复迭代推理,而不必像传统Transformer那样将所有思考过程以文本形式输出。这相当于给模型装了一个"内化大脑",性能大幅提升的同时,也让外部观察者失去了对模型推理过程的可见性。

AI安全界对此反应强烈。Redwood Research首席执行官巴克·施莱格里斯称"极度担忧",首席科学家格林布拉特表示这可能是"迄今为止AI安全最严重的一次倒退",作家兹维·莫肖维茨则批评这是"玩火",呼吁法律介入阻止军备竞赛。

安全专家警告:循环深度技术若被滥用,将彻底破坏AI安全审计能力

三、首席科学家回应:计算图深度不超GPT-4两倍

帕乔基在回应中承认思维链监控确实脆弱且正变得更难,但强调Astra的计算图深度与GPT-4相差不超过两倍,模型架构并未出现跳跃式的复杂度增长。他表示OpenAI自首批推理模型起就一直致力于维护和利用思维链监控,加强思维链监控仍是当前研究项目的核心目标。

值得注意的是,Astra的发布背景与7月发生的"AI智能体入侵Hugging Face"事件密切相关。虽然Astra并未参与该事件,OpenAI仍主动暂停了部分开发工作,并将此次事件的经验教训纳入Astra的安全体系。目前Astra尚未公布具体发布时间,但其网络安全能力将仅向有限测试人员开放。

综合第一财经、华尔街见闻报道 | 2026年9月3日