OpenAI、Anthropic等主流AI服务昨夜集体宕机近4小时

会懂网AI资讯,9月4日,美国东部时间9月3日,OpenAIAnthropicxAI旗下的AI助手相继出现服务中断,一度持续近4小时,目前均已恢复。谷歌Gemini在此次事件中未报告中断,外界因此猜测故障可能与微软Azure有关——这三家平台均依赖Azure提供云计算服务。

AI服务集体宕机

据监测数据,OpenAI受影响最明显:其ChatGPT与Codex在世界协调时上午10点58分左右错误率上升,波及ChatGPT的15个组件与Codex的4个组件,工程团队约24分钟后完成修复;当天早些时候,ChatGPT Work Mode还出现过一次约5分钟的短暂中断。

这不是孤立事件。监测显示,2026年以来AI厂商已合计出现数十次类似中断,多数与推理基础设施的扩容压力有关。当模型能力快速提升、用户量激增,背后的算力集群、网络与调度系统承受的压力同步放大,任何一环的波动都可能演变成大面积的“集体宕机”。

对依赖这些服务的企业客户而言,这一夜是一次真实的压力测试。它凸显了构建多供应商冗余架构的必要性;但业内也提醒,不同厂商模型之间的提示词与输出并不完全可互换,真正的冗余并非简单切换,而需要额外的工程投入来保证行为一致。

从技术视角看,这类故障很少是单一原因,往往是“扩容压力+单点依赖+调度抖动”的叠加。当多家公司同时把推理负载交给同一家云服务商,一次底层平台的波动就会被放大成行业级的“集体失联”。这也再次提醒行业:冗余不能只停留在口号上,而要用工程把它真正落地。

会懂网判断,AI服务正在变成像电力和网络一样的基础设施,而基础设施的可靠性,往往要到第一次大规模中断时才会被认真对待。这次集体宕机给所有人上了一课:在把关键业务跑在单一模型上之前,先想清楚“它挂了我怎么办”。

© 版权声明
THE END
喜欢就支持一下吧
点赞14 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容