cat case/PM-2024-0011.md

Google Cloud 2024-02-14 区域元数据存储需求激增超限,us-west1 大量 GCP 产品控制面错误

P1 · us-west1 区域 GCE/PubSub/Spanner/IAM/Vertex AI 等大量 GCP 产品控制面不可用/错误率升高

summary

2024-02-14 09:45–12:52(US/Pacific),Google Cloud us-west1 区域因区域元数据存储(regional metadata store)遭遇预期外的需求激增,自动扩缩容未能及时跟上,导致大量 GCP 产品控制面延迟与错误升高,部分服务数据面也短暂不可用。

timeline

09:45 区域元数据存储负载异常开始;10:00–12:00 部分 GCE VM 崩溃、Pub/Sub 发布请求大量失败(峰值 65% 发布失败、影响最多 47% 项目);工程通过限流突增工作负载、处理积压恢复;12:52 影响结束。

root_cause

多数 GCP 产品依赖区域元数据存储做内部操作(请求路由、负载均衡、元数据存取)。一次预期外的需求尖峰超出了系统快速增补资源的能力,元数据存储积压,连锁导致控制面错误/延迟。本质是元数据存储的弹性扩容跟不上突发尖峰。

amplifiers

① 区域元数据是大量服务的公共依赖,单点过载半径极大。② 自动扩缩容有滞后:尖峰快于资源增补。③ 控制面受损连带数据面(GCE/Pub/Sub 等)错误。④ 错误率虽多数约 1%,但个别项目/API 影响显著。

mitigation

工程师限流突增的工作负载、处理元数据存储积压,使各产品恢复正常读写;后续改进元数据存储对突发尖峰的监控告警与更激进的自动限流。

lessons

区域级共享元数据/控制面必须按最坏突发尖峰设计弹性;对共享依赖的负载要有更灵敏的自动限流与更早的告警;关键控制面应独立于数据面故障域。

checklist

① 区域元数据存储按突发尖峰压测弹性。② 共享依赖增加自动限流与早期告警。③ 控制面与数据面故障域隔离。④ 演练元数据存储积压的恢复流程。