🎯 科技 · AI与互联网服务

🔥 美国主流AI服务集体宕机暴露云计算底层基础设施脆弱性 巨头垄断反而放大单点故障风险

美国当地时间9月3日一大早,全球AI用户迎来了一个"惊魂时刻"。OpenAI的ChatGPT、Anthropic的Claude以及xAI的Grok几乎同时宣布服务出现异常,DownDetector网站显示谷歌Gemini和微软Copilot的服务中断报告数量也明显上升,AI编程工具Cursor同样受波及。这场席卷美国主流AI服务的大规模宕机事件,让无数依赖AI办公的打工人被迫"回归原始模式"。

事件根源很快浮出水面——罪魁祸首指向了互联网底层基础设施服务商Cloudflare。据Anthropic技术部门员工CJ Avilla在社交媒体透露,此次事件由"基础设施问题"引发。Cloudflare官方状态页面显示,当天出现了两个关键问题:一是影响R2自定义域名HTTP/3请求的问题,部分使用自定义域名连接Cloudflare R2存储的网站在通过HTTP/3发起请求时出现失败或性能下降;二是部分WARP用户的地理位置被错误识别。

这一事件暴露了一个常被忽视的行业隐患:当越来越多的AI服务通过Cloudflare等少数几家基础设施提供商进行流量调度时,单点故障的破坏力被呈指数级放大。Cloudflare作为全球领先的CDN和网络安全公司,处理着互联网上相当大比例的流量,其一旦出现问题,影响的将是整个AI服务层的可用性。

极具讽刺意味的是,宕机事件发生之际,OpenAI正悄然在社交媒体上发布预热视频,宣传即将上架的"Astra"大模型(被外界视为GPT-6的前身)。网友纷纷吐槽:"醒醒,先把机房修好再炫耀吧。"这一插曲也从侧面反映出,AI行业的军备竞赛已经进入白热化阶段,即便在基础设施频频亮红灯的情况下,各大厂商仍在加速推新。

从更宏观的视角来看,此次宕机事件也为AI基础设施的可靠性建设敲响了警钟。随着AI从技术尝鲜走向规模化商用,服务稳定性已成为制约AI普及的关键瓶颈。如何在追求性能极限的同时确保基础设施的冗余性和容灾能力,将是整个行业必须直面的下一道考题。

综合财联社、界面新闻等报道 | 2026年9月4日