summary
2016-06-04 晚(澳洲东部时间 06-05),悉尼遭遇严重风暴,AWS AP-SOUTHEAST-2 某单可用区发生电力事件,大量 EC2 实例与 EBS 卷掉电,引发广泛连接与可用性问题是。
timeline
AWS 状态页于 15:47 报告 EC2 连接问题,16:49 确认单 AZ 电力事件;电力约 1.5 小时后恢复,自动化系统在数小时内恢复了大部分实例与卷,少量因硬件受损需更换或重建。
root_cause
极端天气导致单 AZ 电力失效,部分硬件在断电中受损;同区域其他 AZ 不受影响,但受影响 AZ 的实例/卷恢复需要时间且受硬件损坏拖累。
amplifiers
风暴这类外部环境因素直接打击电力这一容量底座;单 AZ 设计下未跨 AZ 部署的客户直接受影响,恢复还受硬件损坏长尾影响。
mitigation
AWS 恢复电力与实例/卷,并建议受影响的客户启动替换实例/卷以加速恢复;强调多 AZ 部署的重要性。
lessons
关键负载必须跨多 AZ 部署以隔离单点电力故障;对硬件受损的长尾恢复要有替换而非硬修的预案。
checklist
生产负载跨至少 2 个 AZ 部署;断电后优先启动替换实例/卷;对依赖单一区域电力的事前做容灾演练。