🎯 科技 · AI

🔥 美国时间9月3日,ChatGPT、Claude、Grok多家头部AI服务近乎同时出现大规模宕机,暴露AI基础设施的脆弱性

9月3日晚间,全球AI圈迎来了一场罕见的'集体宕机'事件。据服务状态监测平台Downdetector数据显示,OpenAI的ChatGPT和Codex、Anthropic的Claude以及xAI的Grok几乎在同一时间段内出现大规模服务异常,其中OpenAI相关故障报告突破1.2万份,Claude约1200份,Grok约1000份。

从时间线来看,OpenAI在UTC 00:04率先记录到ChatGPT Work Mode高错误率,6分钟后宣布恢复。但到了13:26 UTC,Anthropic状态页陆续挂出多条事件——Claude Mythos 5.1、Fable 5.1、Opus 5等多个模型错误率升高,随后影响范围扩大至Mythos/Fable 5、Opus 4.8、Opus 4.6等全部主流模型。OpenAI也在14:58 UTC再次开事件单'Elevated errors across ChatGPT and Codex',涉及15个ChatGPT群组。

此次事件的根本原因指向了互联网底层基础设施。据Anthropic技术部门员工CJ Avilla在社交媒体透露,此次宕机由'基础设施问题'引发。分析指出,关键互联网基础设施服务商Cloudflare可能出现了问题——其状态页面显示当天存在两项故障:影响R2自定义域名的HTTP/3问题和部分WARP用户地理位置识别错误。由于大量AI服务依赖Cloudflare的CDN和边缘计算节点,一旦底层出现异常,就会引发连锁反应。

此次事件的影响范围远超单一产品。AI编程工具Cursor明确表示,其部分服务因Claude、ChatGPT和Grok故障而间接受到影响。更令人啼笑皆非的是,就在全量宕机发生的同一时段,OpenAI在社交媒体上突然发布了预热视频,显示被称为'GPT-6'的Astra大模型即将上架,引发网友集体吐槽:醒醒,先把机房修好再炫耀吧

业内分析认为,此次集体宕机暴露了当前AI行业的深层隐患——随着ChatGPT、Claude、Grok等产品用户量突破数亿级别,AI服务已深度嵌入企业工作流和日常生活,一旦底层基础设施出现单点故障,影响将是全局性的。如何在追求算力规模的同时构建更具韧性的基础设施,已成为行业亟待解决的课题。

综合财联社、界面新闻、快科技报道 | 2026年9月4日