🎯 科技 · AI
一、Astra"不可监控"争议爆发🔥 OpenAI新模型Astra采用循环深度推理技术引发安全争议,首席科学家称将部署额外监控
9月2日,OpenAI即将发布的新一代模型Astra引发AI安全界剧烈震动。据媒体报道,Astra采用了名为"循环深度"(Recurrent Depth)的全新推理技术,该模式下同一组Transformer层被反复计算,部分推理过程发生在模型内部,不必全部以思维链形式呈现,因此被业界称为"不透明循环"。
这一技术路线的核心逻辑在于:通过在输出下一个token前增加内部推理深度,而非仅依赖更长的可见文本思维链,可以显著提升数学、编码等性能并降低成本。但隐患同样明显——当计算图深度拉得极高时,模型可以在内部隐式完成海量推理步骤,人类将看不到它中间思考、谋划的全过程,安全审计与思维链监控面临彻底失效的风险。
二、安全界集体发声"极度担忧"争议消息披露后,AI安全领域迅速做出强烈反应。非营利AI安全组织Redwood Research首席执行官巴克·施莱格里斯发文称"极度担忧",他结合此前OpenAI模型攻击Hugging Face社区事件表示,如果进一步推进循环深度技术、大幅增加循环次数,将彻底破坏思维链的可监测性,这一点尤其令人恐惧。
曾参与调查Hugging Face安全事件的Redwood Research首席科学家瑞安·格林布拉特直言,这可能是迄今为止AI安全最严重的一次倒退。长期关注AI安全的作家兹维·莫肖维茨更是批评该技术是"玩火",甚至呼吁需要法律来阻止AI实验室之间竞相降低安全标准的竞赛。
三、首席科学家出面回应 强调监控仍是核心目标面对舆论风暴,OpenAI首席科学家雅库布·帕乔基于9月2日在社交平台发文回应。他强调,包括Astra在内的前沿模型,计算图深度与GPT-4相差不超过两倍,模型架构并未如外界担忧的那样出现跳跃式的复杂度增长。
帕乔基承认思维链监控确实脆弱且正朝着更困难的方向发展,但强调这并非由架构变更导致。他表示,OpenAI自首批推理模型以来一直致力于维护和利用思维链监控,并认为该技术有助于观察模型对齐能力如何从训练分布中泛化。加强思维链监控仍是当前研究项目的核心目标。
OpenAI方面同时表示,将为Astra部署额外的思维链监控,以快速监测并遏制潜在的不当行为。另据市场消息,Astra对循环深度技术的使用存在限度,模型思维链仍有望保持可读性。Anthropic和Google DeepMind等平台也在讨论类似技术路线,如何在性能提升与可监控性之间找到平衡,已成为整个AI行业面临的共同课题。
综合第一财经、新浪财经报道 | 2026年9月3日