Correlated failure
termonuvemSuporte de TI
Falhas que acontecem juntas porque o que falhou compartilha alguma coisa - um plano de controle, um pipeline de configuração, um provedor, uma rota física - em vez de falhar de forma independente, como uma conta de redundância pressupõe.
A aritmética de redundância pressupõe independência, e quase nada é independente. Dois fornecedores revendendo uma plataforma, um backup em outra região da mesma nuvem, um DNS secundário que troca tráfego no mesmo ponto: todos se apresentam como diversidade e se comportam como um componente só. O teste prático não é quantos fornecedores aparecem na nota fiscal, e sim o que acontece se qualquer elemento compartilhado for removido - e a resposta em geral precisa ser rastreada no grafo de dependências, não lembrada do diagrama de arquitetura.
Também conhecido como: shared failure domain, common mode failure, retry storm