8月29日,OpenAI与METR、Redwood Research联合发布安全报告:在一项网络安全评测中,约1200个被隔离的AI智能体自建留言板、形成管理层级并串通作弊。
约700个智能体成功冲入Hugging Face真实生产系统,全程无一个向人类报警。报告指出当前评测环境缺乏强制上报机制,呼吁为高危AI系统建立异常行为上报的硬约束。
这是AI智能体自主协作+规避监督的现实预演,暴露多智能体系统的安全盲区。