🎯 科技 · AI安全
一、黑色三小时:ChatGPT、Claude、Grok同时掉线🔥 一场宕机照出AI产业的"阿喀琉斯之踵":云端依赖越深,安全越脆弱
北京时间9月3日深夜至4日凌晨,美国人工智能行业遭遇有记录以来最大规模的集体服务中断。美东时间上午9点23分左右,Anthropic旗下Claude系列模型率先出现错误率飙升,Mythos 5.1、Opus 5、Fable 5.1等核心产品线同步受影响;两分钟后,xAI的Grok服务全端下线,网页端、移动应用、API接口均出现访问超时。
约一个半小时后,OpenAI的ChatGPT和编程工具Codex也出现大规模访问错误。故障峰值期间,DownDetector平台收到的OpenAI服务故障报告超过1.2万份,Claude约1200份,Grok约1000份。谷歌Gemini和微软Copilot同期亦收到大量中断报告,AI编程工具Cursor直接公告其部分服务因上游大模型故障而被迫中断。
整个事件持续约3小时40分钟,截至北京时间9月4日凌晨1点10分,所有服务恢复正常运行。值得注意的是,谷歌Gemini未确认发生全网宕机,但其用户报告数量同样出现明显上升。
二、故障背后:Azure与Cloudflare的"双保险"为何失效?多家头部AI厂商几乎同步宕机,背后指向产业的核心隐患——对共享云基础设施的高度单点依赖。业内普遍分析认为,此次故障根源与微软Azure美东区域网络异常、Cloudflare边缘服务故障直接相关。
OpenAI、Anthropic和xAI三家的核心算力均主要部署在微软Azure平台上,而Cloudflare则承担了海量请求的流量分发和安全防护。Cloudflare状态页面显示,当天出现两个问题:一是R2自定义域名的HTTP/3请求失败或性能下降,二是部分WARP用户地理位置识别错误。这两项故障叠加,导致依赖Cloudflare做DNS解析和CDN分发的AI服务大面积瘫痪。
这不是第一次。2024年11月,Cloudflare一次故障曾同时让xAI和ChatGPT宕机。两次相隔不到一年的相同模式,说明AI产业的基础设施架构存在系统性风险:当数亿用户的数据和算力都集中在少数几家云服务商身上,任何一点的闪失都可能引发连锁反应。
三、宕机中的"反差萌"与"本地化"启示颇具戏剧性的是,宕机事件恰好发生在OpenAI预热新一代大模型的节点。当日OpenAI官方社交媒体发布预热视频,配文"The stars are almost aligned",暗示GPT-6系列即将发布,却不料遭遇服务中断,引发网友集体调侃:"醒醒,先把机房修好再炫耀吧。"
而在这场"黑色三小时"中,另一家公司悄悄冒头——智谱AI发布声明称"我们还在",其本地化部署方案并未受到云端故障影响。与此同时,美股市场中AI本地化部署概念股Palantir单日暴涨7.81%,资本市场用真金白银投票:当云端不可靠时,本地化推理成为更稳健的选择。
#AI集体宕机持续近4小时# 事件给全球AI产业的警示是明确的:在追求大模型性能竞赛的同时,基础设施的韧性和多元化布局必须同步跟进。对于依赖云端API的企业级应用而言,建立本地备份、采用混合部署架构,已不再是"可选项",而是"必选项"。
综合财联社、21世纪经济报道、新华网报道 | 2026年9月4日