摘要
2026-07-14 16:39–17:19 PDT(约 40 分钟),ChatGPT 网页端出现错误率升高与超时,部分用户无法加载页面、新建会话或登录。根因是一次内部 web 流量路由配置变更,将远超预期的流量集中到了较小一部分可用容量上,导致过载。
时间线
- 16:39 PDT :: 状态页标记错误率升高,网页端 ChatGPT 可用性下降
- 17:18 PDT :: 识别异常路由变更并回退流量
- 17:19 PDT :: 流量回到标准部署,错误与登录指标恢复正常
根因
一次内部 web 流量路由配置变更,把远大于预期的流量份额导向了较小一部分可用容量;该容量被瞬间压垮,请求失败或超时。既有防护未能阻止这次路由变更把过多生产流量集中到这些资源上。
放大因素
缺少对分阶段发布中单次流量迁移量的上限保护,路由变更可在无确认、无影响预览的情况下将大量生产流量集中到少数容量。
缓解措施
回退配置恢复服务;强化监控与渐进发布控制,使异常流量偏移能更早被检测并中止;为分阶段发布中可能影响生产流量的路由变更增加单次迁移量上限、确认提示与影响预览。
经验教训
流量路由类配置变更属「隐形扳机」,一个错误的权重即可把全局流量压到少数容量;所有生产流量变更必须走渐进发布、带迁移量上限与一键回退。
检查清单
- 路由/负载均衡变更强制渐进发布与自动回滚
- 为单次生产流量迁移量设硬上限
- 高风险流量变更加确认与影响预览
- 监控需能检测流量在容量间的异常集中