summary
2019 年,Google Cloud 位于比利时 europe-west1-b(圣吉斯兰)的区域连续遭遇多次雷击,导致该数据中心电力中断。虽然 Google 依赖 UPS 与备用发电机,但连续雷击使电力供应反复丢失,部分发电机/电池未能完全接管,造成一部分存储设备(尤其是未做跨区冗余副本的 HDD)数据永久丢失。
timeline
连续闪电击中区域供电,电力多次丢失;UPS/发电机切换在反复冲击下未能完全保障,部分存储节点掉电。电力恢复后,Google 发现部分 HDD 上的数据因非正常掉电而损坏且无可恢复副本,受影响客户收到数据丢失通知。
root_cause
极端外部物理事件(连续雷击)击穿了电力冗余设计;部分数据仅存于单区域/单介质且缺乏足够冗余副本,非正常掉电即造成不可逆丢失。
amplifiers
① 电力冗余被连续事件击穿:UPS/发电机在反复冲击下失效。② 数据冗余不足:部分 HDD 数据无跨区副本,单点损坏即丢失。③ 外部不可控:雷击属自然灾害类外部因素。④ 恢复受限:物理损坏的数据无法重建。
mitigation
恢复电力并尽力从可用副本重建;对受影响客户通报数据丢失并提供支持。Google 后续强化电力冗余与数据多副本策略。
lessons
关键数据必须跨区/跨介质多副本;电力冗余需抵御连续极端事件;对单区域存储明确告知冗余等级;灾难场景要有数据可恢复性承诺。
checklist
① 关键数据强制跨区多副本。② 电力冗余设计抵御连续极端事件。③ 明确单区域存储冗余等级告知客户。④ 定期演练电力故障与数据重建。