AWS SAA-C03/11 - Resiliência e Migração2 min
Estratégias de Disaster Recovery
Responda com suas palavras antes de ler o resto da nota.
- Que problema isso resolve?
- Quando usar / quando NÃO usar?
- Qual o principal trade-off (custo, latência, operação)?
- Que sinal no enunciado aponta pra isso?
- Com o que isso é confundido na prova?
Conceito
Quatro estratégias, do mais barato/lento ao mais caro/rápido. Decore esta ordem — ela resolve várias questões sozinha.
| Estratégia | RPO | RTO | Custo | O que fica ligado na região de DR |
|---|---|---|---|---|
| Backup & Restore | Horas | Horas (até 24 h) | $ | Nada — só os backups |
| Pilot Light | Minutos | Dezenas de minutos | $$ | Só o núcleo de dados replicando; compute desligado |
| Warm Standby | Segundos | Minutos | $$$ | Cópia funcional reduzida, já rodando |
| Multi-Site Active/Active | ~Zero | ~Zero | $$$$ | Ambiente completo servindo tráfego |
A diferença que a prova explora
No Pilot Light, a aplicação não está rodando — só o banco replica. No desastre você precisa provisionar e subir o compute (daí o RTO de dezenas de minutos). No Warm Standby, tudo já está no ar, em escala reduzida. No desastre você só escala (daí o RTO de minutos). A palavra-chave é: está rodando?
Como cada uma se monta na AWS
| Estratégia | Componentes |
|---|---|
| Backup & Restore | AWS Backup, snapshots cross-region, S3 CRR, AMIs copiadas |
| Pilot Light | Read replica cross-region / Aurora Global, AMIs prontas, CloudFormation pra subir o resto |
| Warm Standby | ASG com capacidade mínima + ELB + banco replicando, Route 53 failover |
| Multi-Site | Ambientes completos, Aurora Global ou DynamoDB Global Tables, Route 53 latency/weighted ou Global Accelerator |
Trade-offs
Cada degrau troca dinheiro por tempo. Multi-Site ativo-ativo elimina o downtime e exige resolver consistência de dados entre regiões — escrita nas duas pontas gera conflito, e nem todo banco lida bem com isso (DynamoDB Global Tables resolve por last-writer-wins; bancos relacionais normalmente exigem um writer só).
Backup & Restore é o mais barato e tem um risco frequentemente ignorado: o backup precisa estar em outra região. Snapshot que mora só na região que caiu não serve de nada.
Sinais de prova
- "Menor custo possível" + RTO de horas → Backup & Restore
- "RTO de dezenas de minutos, sem pagar ambiente parado" → Pilot Light
- "RTO de minutos sem ativo-ativo" → Warm Standby
- "Zero downtime, custo não é problema" → Multi-Site ativo-ativo
- "Só o banco replicando, resto desligado" → Pilot Light
- "Ambiente reduzido já no ar" → Warm Standby
- "Failover automático de DNS entre regiões" → Route 53 failover + health check
- "Failover em segundos sem esperar TTL" → Global Accelerator
Relacionado
Parte de 11 - MOC Resiliência e Migração · Documentação AWS