trilha

AWS SAA-C03/11 - Resiliência e Migração2 min

RTO e RPO

Perguntas-guia

Responda com suas palavras antes de ler o resto da nota.

  • Que problema isso resolve?
  • Quando usar / quando NÃO usar?
  • Qual o principal trade-off (custo, latência, operação)?
  • Que sinal no enunciado aponta pra isso?
  • Com o que isso é confundido na prova?

Conceito

Os dois números que decidem a resposta em qualquer questão de disaster recovery.

        ← RPO →          FALHA          ← RTO →
   ─────────────────────────┼──────────────────────────
   último ponto de dado     │            volta no ar
   consistente

   RPO = quanto DADO você aceita perder    (olha pra trás)
   RTO = quanto TEMPO você aceita parado   (olha pra frente)
  • RPO (Recovery Point Objective): distância máxima entre a falha e o último dado recuperável. Backup diário → RPO de 24 horas. Replicação síncrona → RPO próximo de zero.
  • RTO (Recovery Time Objective): tempo máximo aceitável até o serviço voltar. Restaurar de snapshot → horas. Standby ativo → minutos ou segundos.

Como cada número mapeia numa decisão técnica

RPO exigido Mecanismo
24 h Snapshot/backup diário
Minutos Replicação assíncrona (read replica, S3 CRR)
Segundos Aurora Global Database, DynamoDB Global Tables
Zero Replicação síncrona (RDS Multi-AZ)
RTO exigido Mecanismo
Horas Backup & Restore, provisionar do zero
Dezenas de min Pilot Light (subir e escalar o que estava desligado)
Minutos Warm Standby (já rodando, só escalar)
Segundos Multi-Site ativo-ativo + Global Accelerator

Trade-offs

RTO e RPO menores custam exponencialmente mais: cada passo na direção do zero exige infraestrutura parada esperando um desastre que talvez nunca venha. Por isso a pergunta certa nunca é "qual é o mais resiliente", e sim "qual é o mais barato que atende o RTO/RPO declarado".

Existe também o custo escondido do teste: um plano de DR nunca exercitado tem RTO desconhecido na prática. O Well-Architected trata "testar procedimentos de recuperação" como princípio, e a prova cobra isso.

Como a banca arma

Ela dá RTO/RPO e uma restrição de custo, e planta duas alternativas que atendem tecnicamente. A errada é a que atende com folga desnecessária (ativo-ativo pra um RTO de 4 horas) ou a que fica barata abaixo do exigido.

Sinais de prova

  • "Não podemos perder nenhuma transação" → RPO zero → replicação síncrona
  • "Podemos ficar fora do ar por até 4 horas" → RTO de horas → Backup & Restore
  • "Voltar em minutos, sem pagar ativo-ativo" → Warm Standby
  • "RPO de segundos entre regiões" → Aurora Global Database ou DynamoDB Global Tables
  • "Backup diário" → o RPO é 24 h, por definição
  • Enunciado que dá custo como restrição → escolha o mínimo suficiente

Relacionado


Parte de 11 - MOC Resiliência e Migração · Documentação AWS

Buscar

Busca por título, seção e texto das notas