summary
2014-08-07,AWS 都柏林(EU-West-1)某单可用区的电力供应商一台 110kV 变压器失效,导致该 AZ 大面积断电;EBS 卷进入重镜像风暴,恢复历时数天。
timeline
10:41 PDT 变压器失效引发断电;一台发电机 PLC 因接地故障未能并网,UPS 耗尽后该 AZ 几乎全部 EC2 实例与 58% 的 EBS 卷掉电;AWS 手动同步相位恢复部分电力,逐步恢复实例,EBS 因重镜像最慢,至 08-10 仍有少量需人工处理。
root_cause
变压器故障本身已严重,但发电机 PLC 的接地故障使备用电源无法并网,把断电窗口拉长;EBS 在节点离线后需要重镜像/重建,恢复容量不足导致长尾。
amplifiers
电力冗余中关键的 PLC 同步环节存在单点失效;EBS 重镜像风暴在大规模掉电下把恢复时间从小时级拉到天级。
mitigation
AWS 为 PLC 增加冗余与隔离,改进 EBS 直接在原节点恢复的能力(避免全部迁往 S3),并增强控制面负载均衡与沟通。
lessons
电力链路的每个环节(市电、PLC、发电机、UPS)都要独立冗余与演练;海量小对象/卷的恢复必须就地、并行且可节流。
checklist
PLC 做冗余与隔离;EBS 支持原节点快速恢复而非全量搬迁;控制面隔离单 AZ 故障;恢复进度对外透明沟通。