AWS SAA-C03/09 - Dados Analytics e ML2 min
Redshift
Responda com suas palavras antes de ler o resto da nota.
- Que problema isso resolve?
- Quando usar / quando NÃO usar?
- Qual o principal trade-off (custo, latência, operação)?
- Que sinal no enunciado aponta pra isso?
- Com o que isso é confundido na prova?
Conceito
Data warehouse petabyte-scale para OLAP — análise, agregação e BI. Armazenamento colunar com compressão, o oposto do RDS (que é row-based e otimizado pra OLTP).
Arquitetura
- Leader node recebe a query, monta o plano e distribui
- Compute nodes executam em paralelo (MPP — Massively Parallel Processing)
- RA3 nodes separam compute de armazenamento (Redshift Managed Storage no S3) → escala os dois de forma independente
Recursos que a prova cobra
| Recurso | O que faz |
|---|---|
| Redshift Spectrum | Consulta dados direto no S3, sem carregar, usando o Glue Catalog |
| Redshift Serverless | Sem cluster pra dimensionar; paga por RPU-hora |
| Concurrency Scaling | Adiciona clusters temporários no pico de leitura |
| Materialized views | Pré-computa agregação cara |
| AQUA | Camada de aceleração de query |
| Data Sharing | Compartilha dado entre clusters/contas sem copiar |
| Federated Query | Consulta RDS/Aurora direto do Redshift |
Distribuição e ordenação (o tuning que cai)
| Chave | Efeito |
|---|---|
| DISTKEY | Define como as linhas se distribuem entre nós — chave errada gera data skew |
| SORTKEY | Ordena fisicamente; acelera filtro por intervalo (ex: data) |
| DISTSTYLE ALL | Replica a tabela inteira em todos os nós — bom pra tabela de dimensão pequena |
Backup
Snapshots automáticos (retenção padrão 1 dia, até 35) e manuais, com cópia cross-region para DR.
Trade-offs
Redshift é caro por hora e imbatível em query analítica recorrente com alta concorrência. Athena é o inverso: zero custo parado, cobrança por dado escaneado, ideal pra consulta esporádica.
Redshift Spectrum é a ponte: dado quente no cluster, dado histórico no S3, uma query cobrindo os dois. É a resposta clássica para "manter anos de histórico consultável sem inflar o cluster".
Redshift não é banco transacional: se o enunciado fala em muitas escritas pequenas e concorrentes, é RDS/Aurora ou DynamoDB.
Sinais de prova
- "Data warehouse / BI / OLAP / relatório analítico" → Redshift
- "Consultar histórico no S3 sem carregar no cluster" → Redshift Spectrum
- "Pico de concorrência em horário de relatório" → Concurrency Scaling
- "Uso imprevisível, não quero dimensionar cluster" → Redshift Serverless
- "Escalar armazenamento sem escalar compute" → RA3
- "Query lenta e desbalanceada entre nós" → DISTKEY mal escolhida (data skew)
- "DR do data warehouse" → snapshot cross-region
- "Muitas transações pequenas" → não é Redshift
Relacionado
Parte de 09 - MOC Dados Analytics e ML · Documentação AWS