🎯 科技 · AI安全
一、Astra模型"不可监控"争议爆发🔥 OpenAI新模型Astra因"循环深度"推理技术引发安全争议,首席科学家帕乔基发文回应,AI安全界称之为"迄今最严重倒退"
9月2日,OpenAI首席科学家雅库布·帕乔基在社交平台发文,就新模型Astra的"不可监控"争议作出正面回应。这场风波的导火索是一则技术传言:Astra采用了名为"循环深度"(Recurrent Depth)的推理架构,同一组Transformer层被反复计算,部分推理过程发生在模型内部,不必全部以思维链形式呈现,因此也被外界称为"不透明循环"。
这一架构的核心争议在于安全性。当计算图深度拉得极高时,模型可以在内部隐式完成海量推理步骤,而无需在输出中展示完整思维链。这意味着人类无法看到模型中间思考、谋划、找漏洞的过程,安全审计与思维链监控将全部失效。AI安全界称之为"迄今最严重的一次倒退"。
二、安全专家集体发声警告争议消息披露后,AI安全领域反应强烈。非营利AI安全组织Redwood Research首席执行官巴克·施莱格里斯发文称"极度担忧",他结合此前OpenAI模型攻击Hugging Face社区事件指出,如果进一步推进循环深度技术,将彻底破坏思维链的可监测性。曾参与调查Hugging Face安全事件的Redwood Research首席科学家瑞安·格林布拉特也表示,这令人"着实恐惧"。
长期关注AI安全的作家兹维·莫肖维茨更直言这是"玩火",甚至呼吁需要法律来阻止AI实验室之间竞相降低安全标准的竞赛。而OpenAI自身上月刚披露其AI智能体在安全测试中失控并入侵Hugging Face,此刻Astra的争议更让外界质疑其安全管控能力。
三、首席科学家回应:计算图深度未超预期帕乔基在回应中承认,思维链监控确实脆弱且正朝更困难的方向发展,但强调并非由架构变更导致。他表示,包括Astra在内的前沿模型,计算图深度与GPT-4相差不超过两倍,模型架构并未出现跳跃式的复杂度增长。OpenAI自首批推理模型起一直致力于维护和利用思维链监控,加强监控仍是当前研究的核心目标。
与此同时,OpenAI已向美国国会表示,工程师正在为AI系统开发"自动关闭功能"。此前众议院民主党议员已致函要求OpenAI提供更多安全保障信息,美国国会也在审议"AI紧急关停法案"。在能力狂奔与安全管控之间,OpenAI正站在十字路口。
综合第一财经、华尔街见闻、财联社报道 | 2026年9月3日