摘要
2026-08-19 09:05 AM PDT,OpenAI 公共负载均衡器因一次无关的网络配置变更在配置传播过程中意外破裂,导致所有模型 API 与 Playground 流量被切断约 1 小时,级联错误在 2 小时内完全恢复。这是一次影响全部端点的"多小时"中断。
时间线
2026-08-19 09:05 AM PDT公共负载均衡器完全中断,所有 API 请求受影响
约 10:05 AM PDT(事件开始后 1 小时)网络流量开始回流,约一半流量恢复
流量恢复初期部分客户调用某些模型、Moderation API 及修改账单设置时错误率升高(级联问题)
流量恢复后 2 小时内级联问题完全解决
后续 2 小时工程师手动干预,所有系统完全上线
根因
官方确认:一次对 OpenAI 自身网络配置的无关变更("an unrelated change to our network configuration"),在配置传播机制("how network configurations get propagated")中以 OpenAI 不可见的方式破坏了公共负载均衡器。工程师后续定位到底层问题位于网络配置的传播方式,导致负载均衡器意外中断。
放大因素
- 长时间中断触发了内部自动化异常,反而阻碍了全量负载的恢复
- 负载均衡器破裂对 OpenAI 不可见,延迟了诊断与止损
- 流量恢复后部分模型、Moderation API、账单设置变更仍出现级联错误
缓解措施
- 流量恢复后 2 小时内手动解决级联问题
- 后续 2 小时工程师手动干预,使所有系统完全上线
- 工程师已定位网络配置传播机制的底层缺陷,作为长期修复方向
经验教训
- 网络配置变更的传播需具备更严格的可见性与可观测性,避免"对己不可见"的破裂
- 中断恢复期间的自动化需防止误触发阻碍恢复
- 关键入口(公共负载均衡器)应有多层健康检测与快速切换能力
检查清单
- 公共负载均衡器变更前是否完成全链路配置传播验证
- 是否具备对 LB 破裂的端到端可见性告警
- 恢复自动化是否会在长中断时误判并阻碍恢复
- 关键端点是否配置冗余与快速 failover
- 级联依赖(Moderation API、账单设置)是否在主链路恢复后有独立回滚预案