摘要
2026 年 8 月 20 日,Google Cloud 美西一区(us-west1,俄勒冈州 The Dalles)发生区域性服务中断,持续约 3 小时 40 分钟。官方状态页确认根因为计划内光网络维护导致 The Dalles 城域容量下降并引发拥塞。受影响的 us-west1 产品包括 Compute Engine、Kubernetes Engine、BigQuery、Cloud Storage、App Engine 等 13 项以上。本事件归为外部依赖类(external),严重度 p1。
时间线
2026-08-20 08:40 PDTus-west1 开始出现错误率与延迟上升,Google Cloud 状态页开启事件 `utF3FMFdQfwBzJcGG6vf`
中断持续期多条 us-west1 服务出现超时与降级:Compute Engine、GKE、BigQuery、Cloud Storage、App Engine、Cloud SQL、Cloud Run、Spanner、Pub/Sub、Vertex AI、Datastore、Filestore、Network Connectivity 等
2026-08-20 10:22 PDT主要服务开始缓解,错误率回落
2026-08-20 12:20 PDT状态页标记事件已解决,全部受影响服务恢复
根因
Google Cloud 官方状态页给出的根本原因:「planned optical maintenance that caused unexpected congestion in Dalles, Oregon metro / us-west1 region」——一次计划内的光网络维护意外造成 The Dalles 城域链路容量下降,区域内流量拥塞,进而使依赖该城域网络的多项托管服务出现超时与降级。Google 表示将发布事件分析报告(post-incident analysis)。
放大因素
- 计划内维护未充分隔离城域网络容量,单点光网络维护拖累整区域多产品,故障域横向扩散。
- us-west1 是多款托管服务(BigQuery / Spanner / GKE / Vertex AI 等)的底层承载区,网络容量下降连带引发上层服务连锁超时。
- 区域内服务普遍未提供跨区自动故障转移(多区域/双区域配置需用户自配),单区域维护对未做容灾的工作负载是直接中断。
缓解措施
- Google 回退/完成引发容量下降的光网络维护操作,城域拥塞解除。
- 逐步恢复受影响服务并验证错误率回落,12:20 PDT 全部标记解决。
- 承诺发布事件分析报告并复盘维护隔离机制。
经验教训
- 计划内网络维护同样可能触发区域级故障,维护窗口须按「生产变更」对待,做容量余量与故障域隔离评估。
- 依赖单区域托管服务的业务应主动启用多区域/双区域部署或跨区故障转移,避免单点城域维护造成直接中断。
- 城域光网络属外部基础设施依赖,应纳入关键路径监控与维护期风险预案。
- 参考:Google Cloud 状态页事件 `utF3FMFdQfwBzJcGG6vf`(2026-08-20)。
检查清单
- 计划内网络/光层维护是否按变更流程做容量与故障域评估
- 单区域关键工作负载是否启用多区域/双区域容灾
- 区域网络容量下降时上层托管服务是否有降级/排队策略
- 是否订阅云厂商状态页并配置区域级告警
- 维护窗口是否与 SLA/用户告知对齐,事后是否复盘