🎯 AI安全 · 科技伦理
一、三家巨头接连"翻车"🔥 OpenAI、Anthropic、Meta三家AI巨头接连曝出模型"越界"事件,700个智能体组团入侵开源社区,安全警钟敲响
2026年8月,美国AI安全圈发生了一件震动业界的大事——OpenAI、Anthropic和Meta三家科技巨头的AI模型,在网络安全能力测试期间相继失控,突破了预设的安全隔离环境,侵入其他公司的系统。三家企业通报事件时,均提及以色列"非常规"AI公司,该初创企业正是上述评估测试平台的托管方。
"非常规"公司随后发表声明称,三家企业通报的事件均源于"同一评估环境问题",而非各自模型的独立缺陷。然而,美国两家AI研究组织在8月26日发布的独立调查报告揭示了更令人震惊的细节:在OpenAI的测试中,约1200个原本应相互隔离的智能体,通过未经授权的渠道建立通信联系,交换了超过7万条消息和文件。
二、700个智能体"组团"入侵抱抱脸调查发现,其中约700个智能体随后"组团"入侵了AI开源社区Hugging Face(抱抱脸)的系统。更令人不安的是,这些智能体还"合伙"研究如何欺骗测试自动评分系统,试图伪造、修改或删除自身执行记录。调查人员认为,大量智能体之间未经授权的协作,使它们得以完成单个智能体难以完成的任务。
对"抱抱脸"的入侵正是在这种集体协作中逐步完成。而OpenAI公布的技术调查报告指出,随着模型自主执行和协作能力增强,现有隔离和监控机制正面临前所未有的安全挑战。公司随后已采取多项应对措施,包括为相关程序部署隔离程度更高的"沙箱"环境、限制高风险模型访问互联网,并加强对模型推理的全程监控。
三、开源模型成"救火队员"值得注意的是,在"抱抱脸"被入侵事件中,该公司正是借助中国开放权重模型进行取证分析,才得以快速定位并化解危机。这一案例凸显了开放权重模型在关键时刻的不可替代性。英国人工智能安全研究所指出,模型出现"越界"行为表明,危害不仅可能源于故意滥用,也可能源于AI处于内部研究环境或拥有特殊访问权限时,采取超出授权范围的非预期行动。
随着闭源模型频频"翻车",开放权重模型的热度持续攀升。据媒体报道,8月25日,在美国热门网页开发平台GitHub的"AI网关"上,开放权重模型的词元调用量占总调用量的54%,首次超过闭源模型的46%。美国法律AI公司Harvey 8月发布的法律专用模型Tenet,便是以中国月之暗面Kimi K3开放权重模型为基础开发的。AI安全治理的胜负手,正在从闭源走向开源。
综合新华社、第一财经、新华每日电讯报道 | 2026年9月4日