fault tolerance
termoredesnuvem
Continuar prestando serviço enquanto algo está quebrado - o que exige decidir de antemão quais falhas são sobreviventes e pagar por isso em redundância.
A palavra é usada de forma solta, e a versão útil é específica: você tolera as falhas para as quais projetou, e nenhuma outra. Isso significa nomeá-las - uma alimentação, um disco, um sítio, uma região - e aceitar que qualquer coisa não nomeada vai derrubar o serviço. O erro recorrente é redundância que divide uma dependência: dois equipamentos na mesma régua, dois enlaces no mesmo duto, duas regiões com um provedor de identidade só. A segunda cópia só ajuda se falhar de forma independente, e independência é a propriedade que as pessoas esquecem de comprar.
Também conhecido como: resilience, high availability