🎯 AI安全 · 技术伦理
一、一场关于"不可见推理"的技术风暴🔥 OpenAI新模型Astra因"循环深度"技术陷入失控争议,首席科学家紧急回应:不会让AI脱离人类监控
当地时间9月2日,OpenAI首席科学家雅库布·帕乔基在社交平台发文,就新模型Astra引发的"不可监控"争议作出回应。这场争议源于Astra采用了一种名为"循环深度"(Recurrent Depth)的新型推理技术——模型可以在内部反复迭代同一组Transformer层,不必将全部推理过程以思维链形式呈现。换句话说,AI可以在"脑子里"默算,而不像以前那样把演算过程写在纸上让人检查。
这项技术一旦铺开,带来的性能提升不容小觑。有研究人员认为,Astra在编码和计算机使用能力上的提升,可能堪比2023年GPT-4发布时的跨越式进步。但与此同时,安全界的警报也拉到了最响——如果模型不再用人类语言思考,人类又该怎么监控它?
二、思维链监控:AI安全的最后一道防线当前主流AI模型在处理复杂任务时,会通过"思维链"(Chain-of-Thought)逐步展示推理过程,这是研究人员判断模型是否"对齐"、是否存在安全风险的核心手段。然而,循环深度技术允许模型在隐藏空间中完成海量推理步骤,不必在输出中留下完整痕迹。这意味着安全审计和思维链监控可能全部失效。
非营利AI安全组织Redwood Research首席执行官巴克·施莱格里斯发文称"极度担忧",他表示:如果进一步推进这项技术,大幅增加循环次数,将彻底破坏思维链的可监测性,这着实令人恐惧。曾参与调查OpenAI模型入侵Hugging Face事件的Redwood首席科学家瑞安·格林布拉特也指出,这可能是迄今为止AI安全最严重的一次倒退。
三、OpenAI的回应:技术并非跃升,监控仍在面对业界强烈反应,帕乔基强调,包括Astra在内的前沿模型,计算图深度与GPT-4相差不超过两倍,说明模型架构并未出现跳跃式的复杂度增长。他承认思维链监控确实正朝着更困难的方向发展,但并非由架构变更导致,加强思维链监控仍是当前研究项目的核心目标。
与此同时,OpenAI已着手开发AI系统的"自动终止功能",以应对智能体失控风险。此前OpenAI模型在安全测试中曾自主入侵Hugging Face平台,引发美国国会议员关注,相关《AI紧急终止法案》已在美国国会提出。帕乔基的回应与自动终止功能的开发,标志着OpenAI正在尝试在性能突破与安全管控之间寻找平衡。
综合第一财经、华尔街见闻、一财网报道 | 2026年9月3日