AWS SAA-C03/11 - Resiliência e Migração2 min
RTO e RPO
Responda com suas palavras antes de ler o resto da nota.
- Que problema isso resolve?
- Quando usar / quando NÃO usar?
- Qual o principal trade-off (custo, latência, operação)?
- Que sinal no enunciado aponta pra isso?
- Com o que isso é confundido na prova?
Conceito
Os dois números que decidem a resposta em qualquer questão de disaster recovery.
← RPO → FALHA ← RTO →
─────────────────────────┼──────────────────────────
último ponto de dado │ volta no ar
consistente
RPO = quanto DADO você aceita perder (olha pra trás)
RTO = quanto TEMPO você aceita parado (olha pra frente)
- RPO (Recovery Point Objective): distância máxima entre a falha e o último dado recuperável. Backup diário → RPO de 24 horas. Replicação síncrona → RPO próximo de zero.
- RTO (Recovery Time Objective): tempo máximo aceitável até o serviço voltar. Restaurar de snapshot → horas. Standby ativo → minutos ou segundos.
Como cada número mapeia numa decisão técnica
| RPO exigido | Mecanismo |
|---|---|
| 24 h | Snapshot/backup diário |
| Minutos | Replicação assíncrona (read replica, S3 CRR) |
| Segundos | Aurora Global Database, DynamoDB Global Tables |
| Zero | Replicação síncrona (RDS Multi-AZ) |
| RTO exigido | Mecanismo |
|---|---|
| Horas | Backup & Restore, provisionar do zero |
| Dezenas de min | Pilot Light (subir e escalar o que estava desligado) |
| Minutos | Warm Standby (já rodando, só escalar) |
| Segundos | Multi-Site ativo-ativo + Global Accelerator |
Trade-offs
RTO e RPO menores custam exponencialmente mais: cada passo na direção do zero exige infraestrutura parada esperando um desastre que talvez nunca venha. Por isso a pergunta certa nunca é "qual é o mais resiliente", e sim "qual é o mais barato que atende o RTO/RPO declarado".
Existe também o custo escondido do teste: um plano de DR nunca exercitado tem RTO desconhecido na prática. O Well-Architected trata "testar procedimentos de recuperação" como princípio, e a prova cobra isso.
Ela dá RTO/RPO e uma restrição de custo, e planta duas alternativas que atendem tecnicamente. A errada é a que atende com folga desnecessária (ativo-ativo pra um RTO de 4 horas) ou a que fica barata abaixo do exigido.
Sinais de prova
- "Não podemos perder nenhuma transação" → RPO zero → replicação síncrona
- "Podemos ficar fora do ar por até 4 horas" → RTO de horas → Backup & Restore
- "Voltar em minutos, sem pagar ativo-ativo" → Warm Standby
- "RPO de segundos entre regiões" → Aurora Global Database ou DynamoDB Global Tables
- "Backup diário" → o RPO é 24 h, por definição
- Enunciado que dá custo como restrição → escolha o mínimo suficiente
Relacionado
Parte de 11 - MOC Resiliência e Migração · Documentação AWS