cat case/PM-2026-0714.md

ChatGPT 网页中断:流量路由配置变更致容量过载

P1 · 部分 ChatGPT 网页用户报错/超时,无法加载、新建会话或登录

摘要

2026-07-14 16:39–17:19 PDT(约 40 分钟),ChatGPT 网页端出现错误率升高与超时,部分用户无法加载页面、新建会话或登录。根因是一次内部 web 流量路由配置变更,将远超预期的流量集中到了较小一部分可用容量上,导致过载。

时间线

  • 16:39 PDT :: 状态页标记错误率升高,网页端 ChatGPT 可用性下降
  • 17:18 PDT :: 识别异常路由变更并回退流量
  • 17:19 PDT :: 流量回到标准部署,错误与登录指标恢复正常

根因

一次内部 web 流量路由配置变更,把远大于预期的流量份额导向了较小一部分可用容量;该容量被瞬间压垮,请求失败或超时。既有防护未能阻止这次路由变更把过多生产流量集中到这些资源上。

放大因素

缺少对分阶段发布中单次流量迁移量的上限保护,路由变更可在无确认、无影响预览的情况下将大量生产流量集中到少数容量。

缓解措施

回退配置恢复服务;强化监控与渐进发布控制,使异常流量偏移能更早被检测并中止;为分阶段发布中可能影响生产流量的路由变更增加单次迁移量上限、确认提示与影响预览。

经验教训

流量路由类配置变更属「隐形扳机」,一个错误的权重即可把全局流量压到少数容量;所有生产流量变更必须走渐进发布、带迁移量上限与一键回退。

检查清单

  • 路由/负载均衡变更强制渐进发布与自动回滚
  • 为单次生产流量迁移量设硬上限
  • 高风险流量变更加确认与影响预览
  • 监控需能检测流量在容量间的异常集中