🎯 科技 · AI安全
一、争议缘起:循环深度技术引发"不可监控"担忧🔥 OpenAI新模型Astra因"不透明循环"推理技术引发安全争议,首席科学家承认监控难度增加但仍坚持优化
当地时间9月2日,OpenAI首席科学家雅库布·帕乔基(Jakub Pachocki)在社交平台发文,就新模型Astra的"不可监控"争议作出回应。这场风波源于此前一天,有消息称即将发布的Astra模型采用了名为"循环深度"(Recurrent Depth)的推理技术。该模式下,同一组Transformer层被反复计算,部分推理过程发生在模型内部,不必全部以思维链形式呈现,因此被称为"不透明循环"。#OpenAI新模型Astra失控争议# 核心争议在于:当模型可以在内部隐式完成海量推理步骤,而不在输出中呈现完整思维链时,人类将无法追踪其思考过程,安全审计和思维链监控可能彻底失效。
AI安全界对此反应强烈。非营利AI安全组织Redwood Research首席执行官巴克·施莱格里斯发文称"极度担忧",曾参与调查Hugging Face安全事件的Redwood Research首席科学家瑞安·格林布拉特表示"这可能是迄今为止AI安全最严重的一次倒退"。长期关注AI安全的作家兹维·莫肖维茨则批评这一技术是"玩火",甚至表示需要法律来阻止AI实验室之间竞相降低标准的竞赛。
二、首席科学家回应:计算图深度未出现跳跃式增长帕乔基在回应中强调,包括Astra在内的前沿模型,计算图深度与GPT-4相差不超过两倍,说明模型架构并未如外界担忧的那样出现跳跃式的复杂度增长。计算图深度是指模型完成一次推理任务必须依次执行、无法并行加速的最长计算步骤链条。过去普通Transformer架构下的层内计算可以大规模并行,串行的深度约等于模型层数。
帕乔基同时承认,思维链监控确实脆弱,且正朝着更困难的方向发展,但并非由架构变更导致。OpenAI自首批推理模型一直致力于维护和利用思维链监控,并认为该技术有助于观察模型对齐能力如何从训练分布中泛化。加强思维链监控仍是当前研究项目的核心目标。不过,这一回应未能完全平息安全界的担忧——毕竟,当模型内部推理深度不断增加,即使没有跳跃式增长,累积效应也可能导致监控失效。
三、安全与效率的博弈:AI发展的永恒难题循环深度技术的吸引力在于,它可以在不显著增加可见计算成本的前提下,通过内部反复迭代提升数学、编码等性能。这意味着在相同算力预算下,模型可以获得更强的推理能力。然而,这种"隐性计算"的本质代价是安全透明度的丧失。当模型可以在内部"默默思考"而不留下可追踪的痕迹时,无论是事前的安全对齐还是事后的事故调查,都将面临前所未有的挑战。
值得注意的是,就在Astra争议发酵的同时,美国国会已提出"AI紧急关停法案",要求最先进的AI系统保留关停、限速等技术能力。OpenAI也在向议员表示,工程师正在为AI系统开发"自动关闭功能"。这表明整个行业正在意识到:AI能力的提升与安全可控必须同步推进,任何单向度的狂奔都可能在关键时刻付出惨重代价。Astra的争议,或许正是这场博弈的一个缩影。
综合第一财经、财联社报道 | 2026年9月3日