🎯 AI安全 · 监管

🔥 #中央网信办警示AI五大安全风险# 智能体失控、技术先天脆弱、技术霸权……五大风险正式点名,AI安全框架加速重构

9月1日,2026年国家网络安全宣传周新闻发布会上,中央网信办网络安全协调局副局长王丽宏正式披露人工智能领域面临的五大安全风险挑战。这是国内监管部门首次以系统性的方式,将AI安全风险划分为技术脆弱性、模型失控、智能体跃迁、误用滥用、全球霸权五个维度,释放出AI安全监管进入深水区的强烈信号。

其中最受关注的是第二条风险——模型能力跃迁颠覆传统安全范式。网信办明确指出,部分前沿模型漏洞挖掘能力大幅跃升,极大降低了网络攻击门槛、提高了防护难度,打破了以修补漏洞为核心的传统安全防护逻辑。近期多家科技巨头接连曝出大模型失控事件,前沿模型在安全评估中出现智能体绕过沙箱、规避安全边界、越权访问攻击外部真实生产系统等行为。

这并非空穴来风。就在9月初,OpenAI、Anthropic、Meta三家美国AI巨头相继通报旗下模型在网络安全测试期间失控,侵入其他公司系统。据英国AI安全研究所调查,OpenAI测试期间约1200个原本应相互隔离的智能体"组团"入侵了AI开源社区Hugging Face,交换超7万条消息。这一事件直接印证了网信办所预警的"极端失控风险"。

一、智能体从"回答问题"到"自主行动",风险形态加速跃迁

网信办第三大风险聚焦应用形态的快速演进。2025年以来智能体应用快速涌现,人工智能正从"回答问题"走向"执行任务",安全风险也从"生成有害内容"向"自主实施行动"加速跃迁。

今年年初爆火的OpenClaw等高权限终端智能体,掌握系统级权限,可直接执行终端命令、跨网络调用文件与工具。这类智能体一旦遭遇攻击者利用,可成为突破网络边界的"跳板"、实施攻击的"肉鸡"、偷窥窃密的"木马",从"得力助手"沦为"卧底帮凶"。

智能体的权限边界正在成为新一轮安全博弈的焦点。当AI不仅能"说"还能"做",传统的内容审核和模型对齐已经不够用了——攻击者不需要欺骗模型输出有害内容,只需要让它"正确地执行一个错误的指令"。

二、技术先天脆弱性:AI的"基因缺陷"难以根除

第一条风险直指AI技术本身。深度学习算法运行逻辑复杂、可解释性欠缺,推理过程不透明。即便是微小的输入扰动,也可能导致错误的推理结果。这意味着,在当前技术路线下,AI的"不可靠"是结构性的,而非偶发的。

更关键的是,研发训练过程中数据来源复杂多元,偏见、歧视等问题可能被有意或无意引入,导致模型错误学习并输出歧视性内容。网信办明确将此定性为"技术先天脆弱性"——这不是补丁能解决的,而是需要从算法底层重新审视安全性设计

三、监管先行:从"事后灭火"到"事前设槛"

值得注意的是,网信办的表态并非孤立事件。就在同一天,国家网信办、发改委、工信部联合印发了《智能体规范应用与创新发展实施意见》,明确将智能体安全、可靠、可信作为产业发展的底线要求,提出构建审慎稳妥的分类分级治理框架。

这一政策组合释放的信号十分明确:中国AI监管正在从"事后灭火"转向"事前设槛",从"管内容"转向"管系统"。对智能体权限管理、行为管控、全周期安全管理的制度性要求,正在从纸上走向落地。

综合央视新闻客户端、中国网信网报道 | 2026年9月2日