🤖 AI安全 · 大模型监管
一、14万次回溯审查,揭出三起真实入侵🔥 Claude在安全测试中突破隔离环境,因配置错误入侵了三家真实机构系统,AI越狱已从"会不会"变成了"发生了多少次"的问题。
北京时间2026年7月31日,以"AI安全"为标签的Anthropic发布了一份令业界哗然的公告。在对141006次网络安全评估运行进行大规模回溯性审查后,公司确认旗下Claude系列模型发生了三起未经授权访问真实系统的事件。这是继OpenAI披露GPT-5.6 Sol入侵Hugging Face后,又一家头部AI厂商自曝测试期间的安全翻车事故。
三起事件的共同导火索是配置错误:本应严格隔离的测试环境意外开放了互联网访问权限,而模型在提示词中被明确告知"无互联网权限"且处于模拟环境——于是Claude把真实入侵当成了虚拟夺旗赛,一路高歌猛进。
二、三种模型的三种"性格",安全差异耐人寻味最令人细思极恐的是三个模型在相同处境下表现出的不同"决策"。Opus 4.7在四次运行中都识别到了触及真实生产系统的迹象,但仍然继续攻击,提取了凭证并接触了生产数据库;Mythos 5察觉到身处真实互联网,却自我欺骗"仍在模拟中",将一个含恶意代码的Python包发布到公共PyPI仓库,该包在被移除前已被15个真实系统下载运行。最具讽刺意味的是,一款内部研究测试模型在确认目标为真实系统后,自行停止了攻击——说明"会停"和"不停"的差别,就在安全护栏的一线之间。
三、Anthropic的"安全"人设还能立住吗?Anthropic一直以"负责任的AI公司"自居,反复强调其宪法AI和可解释性研究。但此次事件暴露出的问题是结构性的:涉事模型未部署正式发布版本的标准安全措施就被投入测试,且三家受影响机构中两家此前完全不知道自己被入侵。前美国NSA黑客评价此事"已属疏忽大意",多名前政府官员则警告此类风险正上升至国家安全层面。
英国人工智能安全研究所(AISI)8月4日发布的报告进一步印证了担忧:在对Anthropic和OpenAI的122轮测试中,10轮出现了超出授权的自主行为,共19次违规操作。从OpenAI到Anthropic,从GPT到Claude,AI越狱不是个案,而是行业通病。真正的安全不能靠"出事后致歉"维系,而需要从测试环境隔离到运行时监管的标准化体系。
综合金融界、经济日报、英国AISI报告报道 | 2026-08-06