summary
2024-01-18 06:52 UTC 起,Atlassian 的 Jira 系列(Jira Work Management、Jira Software、Jira Product Discovery 等)开始向用户返回 503 与服务不可用错误,持续约 4 小时,10:30 UTC 恢复。Atlassian 将性能下降归因于「内部 Atlassian Marketplace 服务的预定数据库升级」:该服务响应时间增加并最终超时,降级随后向上游级联,导致 Jira 家族请求超时、体验受损。
timeline
06:52 UTC Jira 产品系列开始返回 503/错误。性能下降表现为响应时间增加并最终超时,随后级联上行影响整个 Jira 家族。Atlassian 工程团队排查并恢复 Marketplace 服务及其依赖。10:30 UTC 据 ThousandEyes 报告 Jira 服务恢复正常。
root_cause
根因是一次预定的内部 Atlassian Marketplace 服务数据库升级。该升级使 Marketplace 服务响应时间增加直至超时;由于 Jira 产品家族依赖该内部服务,其降级通过依赖链向上游级联,使 Jira 各产品的请求超时。
amplifiers
① 内部依赖级联:核心产品家族依赖一个内部 Marketplace 服务,单点超时扩散。② 预定变更风险:在业务时段进行的数据库升级缺乏充分容量/超时保护。③ 超时传播:下游未对上游超时做熔断,使降级放大为家族级 503。
mitigation
恢复 Marketplace 服务数据库升级的影响,使其响应时间回到正常,Jira 家族请求超时随之解除。后续强化内部服务依赖的隔离、超时与熔断。
lessons
内部服务依赖需设置超时、熔断与降级,避免单点超时级联;预定数据库升级应选低峰并做容量评估;核心产品不应硬依赖非核心内部服务。
checklist
① 内部服务调用强制超时+熔断+降级。② 数据库升级选低峰并演练回滚。③ 核心产品对非核心依赖做解耦。④ 依赖拓扑演练与混沌测试。