摘要
2026 年 9 月 3 日,OpenAI 的 ChatGPT 与 Codex 出现约 34 分钟的部分不可用中断,用户访问时收到 404 Not Found 错误。OpenAI 发言人将根因归因于一次「路由错误(routing error)」,并称已于约 34 分钟后实施修复。该事件与同日 xAI Grok(孟菲斯算力中心)、Anthropic Claude(基础设施问题)中断窗口高度重叠,但 WIRED 核实 Cloudflare / AWS / Azure / Google Cloud 当窗状态页均正常,证实三者为相互独立的故障,非共享基础设施所致。本事件归为配置类(config),严重度 p2。
时间线
2026-09-03 07:43 PT一次路由错误开始,使部分用户跨平台的 ChatGPT 与 Codex 不可用,出现 404 错误
2026-09-03 约 08:17 PTOpenAI 成功实施解决方案,持续监控
2026-09-03 约 11:55 PT(UTC 时间线对应)监控期结束后事件关闭
同期(06:23 PT 起)Anthropic Claude 率先报错;06:30 PT 起 xAI Grok 全平台中断——三者窗口重叠约 93 分钟,但各自根因独立
根因
OpenAI 官方归因:一次路由错误(routing error)使 ChatGPT 与 Codex 对部分用户跨平台不可用。在网络中,路由如同引导数据包抵达正确目标服务器的「路标」;当这些路标被错误配置,用户请求会被导向不存在的路径,从而 severed 与服务的连接,表现为 404 Not Found。OpenAI 未将该问题归因于任何外部服务商,明确为内部网络配置问题,并实施缓解后恢复。
需注意:OpenAI 仅以「路由错误」这一层级归因,未公开具体是哪条路由配置出错、涉及哪些上游系统,属厂商披露但未深挖的归因。
放大因素
- 路由配置错误直接导致用户请求被导向不存在的路径,呈现为 404 而非优雅降级,用户体验冲击明显。
- 事件与 Grok、Claude 中断窗口重叠,初期被误读为「共享云底座塌方」,但 hyperscaler 状态页实测排除了共享依赖。
- 自动化多模型故障转移(failover)会把海量请求在毫秒级迁往备用模型,可能把局部中断放大为跨厂商连锁——本事件凸显该反馈回路风险。
缓解措施
- OpenAI 在约 34 分钟内定位并实施路由修复,随后进入监控期确认恢复。
- 未公开额外架构层面的整改,仅确认服务恢复正常。
经验教训
- 路由配置属核心网络配置,变更须走分级灰度与健康门禁,避免错误路由把流量导向无效路径。
- 内部网络配置错误应优先返回优雅降级而非 404 硬失败,降低用户感知冲击。
- 「同时段多厂商中断」须以 hyperscaler / CDN 状态页实测为据判定是否共享依赖,不可想当然。
- 多模型自动 failover 若缺乏熔断 / 流量整形,会把局部中断放大为跨服务传染,需电路 breaker 模式兜底。
检查清单
- 路由 / 网络配置变更是否走分级灰度与健康门禁
- 内部配置错误是否返回优雅降级而非 404 硬失败
- 是否以 hyperscaler / CDN 状态页实测佐证「共享依赖」假设
- 多模型自动 failover 是否配置电路 breaker 与流量整形,避免雷击式迁移
- 是否对关键路径配置请求重试与备用终点,且不制造反馈回路
- 是否订阅 OpenAI 状态页并配置租户级告警