summary
2022-12-18 09:23,阿里云香港 Region 可用区 C 部分 ECS 服务器开始停机并触发同可用区内宕机迁移;随包间温度升高,受影响服务器持续增加,影响扩大到该可用区的 EBS、OSS、RDS 等更多云服务。根因是机房冷却系统缺水进气形成气阻,导致 4 台主冷机异常,而备用冷机因主备共用同一水路循环系统的气阻也启动失败;高温最终触发消防喷淋,电源柜与多列机柜进水、部分硬件损坏,使恢复难度与时长大幅增加。这是阿里云运营十多年来持续时间最长的一次大规模故障。
timeline
08:56 温控告警,工程师介入。09:01 冷机异常。09:09 主备切换/重启失败。10:30 起为避免高温消防问题对集群降载。14:47 一包间高温触发强制消防喷淋。15:20 冷机群控解锁并独立运行,首台恢复。18:55 4 台冷机恢复制冷。19:02 分批启动服务器。21:36 多数包间服务器完成检查。22:50 最后一包间数据安全检查后恢复供电。次日凌晨 00:30 所有服务恢复(部分客户至 19 日中午才恢复,停摆 >24h)。
root_cause
冷却系统缺水进气形成气阻,影响水路循环,4 台主冷机服务异常;启动 4 台备冷机时因主备共用同一水路循环系统的气阻再次失败。补水后受群控逻辑限制无法单台独立启动,需手工改配置解锁群控,显著拖长冷却恢复。高温最终触发消防喷淋,进水损坏硬件。
amplifiers
① 气阻+群控耦合:主备共用水路且群控逻辑禁止单台启动,极小故障被放大为长时间冷却失效。② 消防喷淋二次伤害:进水损坏电源柜与机柜硬件,增加恢复难度。③ 处置不及时:原因定位 3h34m、补水排气 2h57m、解锁群控 3h32m,恢复链路过长。④ 控制面连带:香港 Region ECS 管控服务(跨可用区)受限流,可用性最低跌至 20%。
mitigation
手工解锁冷机群控改为独立运行并陆续启动;对高温包间降载保护;消防喷淋后做数据完整性检查再上电。阿里云致歉并启动赔偿,承诺改进制冷冗余、群控策略与故障信息发布透明度。
lessons
制冷系统主备必须独立水路避免共因失效;群控逻辑需支持单台应急启动;消防设施触发应有防水与快速干燥预案;故障信息发布需及时透明。
checklist
① 冷机主备水路物理隔离。② 群控支持单台/手动应急启动。③ 消防喷淋后有硬件防水与数据安全检查流程。④ 跨可用区控制面限流保护与健康度监控。