cat case/PM-google-uswest1-20260820.md

Google Cloud us-west1(The Dalles)区域中断(2026-08-20)

P1 ·

摘要

2026 年 8 月 20 日,Google Cloud 美西一区(us-west1,俄勒冈州 The Dalles)发生区域性服务中断,持续约 3 小时 40 分钟。官方状态页确认根因为计划内光网络维护导致 The Dalles 城域容量下降并引发拥塞。受影响的 us-west1 产品包括 Compute Engine、Kubernetes Engine、BigQuery、Cloud Storage、App Engine 等 13 项以上。本事件归为外部依赖类(external),严重度 p1。

时间线

2026-08-20 08:40 PDTus-west1 开始出现错误率与延迟上升,Google Cloud 状态页开启事件 `utF3FMFdQfwBzJcGG6vf`
中断持续期多条 us-west1 服务出现超时与降级:Compute Engine、GKE、BigQuery、Cloud Storage、App Engine、Cloud SQL、Cloud Run、Spanner、Pub/Sub、Vertex AI、Datastore、Filestore、Network Connectivity 等
2026-08-20 10:22 PDT主要服务开始缓解,错误率回落
2026-08-20 12:20 PDT状态页标记事件已解决,全部受影响服务恢复

根因

Google Cloud 官方状态页给出的根本原因:「planned optical maintenance that caused unexpected congestion in Dalles, Oregon metro / us-west1 region」——一次计划内的光网络维护意外造成 The Dalles 城域链路容量下降,区域内流量拥塞,进而使依赖该城域网络的多项托管服务出现超时与降级。Google 表示将发布事件分析报告(post-incident analysis)。

放大因素

  • 计划内维护未充分隔离城域网络容量,单点光网络维护拖累整区域多产品,故障域横向扩散。
  • us-west1 是多款托管服务(BigQuery / Spanner / GKE / Vertex AI 等)的底层承载区,网络容量下降连带引发上层服务连锁超时。
  • 区域内服务普遍未提供跨区自动故障转移(多区域/双区域配置需用户自配),单区域维护对未做容灾的工作负载是直接中断。

缓解措施

  • Google 回退/完成引发容量下降的光网络维护操作,城域拥塞解除。
  • 逐步恢复受影响服务并验证错误率回落,12:20 PDT 全部标记解决。
  • 承诺发布事件分析报告并复盘维护隔离机制。

经验教训

  • 计划内网络维护同样可能触发区域级故障,维护窗口须按「生产变更」对待,做容量余量与故障域隔离评估。
  • 依赖单区域托管服务的业务应主动启用多区域/双区域部署或跨区故障转移,避免单点城域维护造成直接中断。
  • 城域光网络属外部基础设施依赖,应纳入关键路径监控与维护期风险预案。
  • 参考:Google Cloud 状态页事件 `utF3FMFdQfwBzJcGG6vf`(2026-08-20)。

检查清单

  • 计划内网络/光层维护是否按变更流程做容量与故障域评估
  • 单区域关键工作负载是否启用多区域/双区域容灾
  • 区域网络容量下降时上层托管服务是否有降级/排队策略
  • 是否订阅云厂商状态页并配置区域级告警
  • 维护窗口是否与 SLA/用户告知对齐,事后是否复盘