AI安全|OpenAI发布Astra模型越强大越难监控 思维链失效引安全隐忧

9月4日消息,OpenAI于9月3日发布GPT-6 Astra旗舰模型,被称为日井最强模型和AGI时代开篇之作。然而,安全技术文档披露了一个令人不安的事实:Astra越聪明,越难监控其思维过程

核心发现
• Astra采用循环深度推理架构,可在传统顺序思维架构之外运行
• 模型越强大,内部思维链越难被外部观察和验证
• 内部测试中发现并利用两个零日漏洞,但网络安全能力暂不全面开放
• API定价为每百万输入Token 10美元、输出50美元,约为GPT-5.6的2.5倍

AI安全专家警告,随着模型能力增强,黑箱问题将日益严重,这可能影响AI系统的可解释性和安全性保障,引发关于AGI时代安全治理的广泛讨论。