trilha

AWS SAA-C03/09 - Dados Analytics e ML2 min

Redshift

Perguntas-guia

Responda com suas palavras antes de ler o resto da nota.

  • Que problema isso resolve?
  • Quando usar / quando NÃO usar?
  • Qual o principal trade-off (custo, latência, operação)?
  • Que sinal no enunciado aponta pra isso?
  • Com o que isso é confundido na prova?

Conceito

Data warehouse petabyte-scale para OLAP — análise, agregação e BI. Armazenamento colunar com compressão, o oposto do RDS (que é row-based e otimizado pra OLTP).

Arquitetura

  • Leader node recebe a query, monta o plano e distribui
  • Compute nodes executam em paralelo (MPP — Massively Parallel Processing)
  • RA3 nodes separam compute de armazenamento (Redshift Managed Storage no S3) → escala os dois de forma independente

Recursos que a prova cobra

Recurso O que faz
Redshift Spectrum Consulta dados direto no S3, sem carregar, usando o Glue Catalog
Redshift Serverless Sem cluster pra dimensionar; paga por RPU-hora
Concurrency Scaling Adiciona clusters temporários no pico de leitura
Materialized views Pré-computa agregação cara
AQUA Camada de aceleração de query
Data Sharing Compartilha dado entre clusters/contas sem copiar
Federated Query Consulta RDS/Aurora direto do Redshift

Distribuição e ordenação (o tuning que cai)

Chave Efeito
DISTKEY Define como as linhas se distribuem entre nós — chave errada gera data skew
SORTKEY Ordena fisicamente; acelera filtro por intervalo (ex: data)
DISTSTYLE ALL Replica a tabela inteira em todos os nós — bom pra tabela de dimensão pequena

Backup

Snapshots automáticos (retenção padrão 1 dia, até 35) e manuais, com cópia cross-region para DR.

Trade-offs

Redshift é caro por hora e imbatível em query analítica recorrente com alta concorrência. Athena é o inverso: zero custo parado, cobrança por dado escaneado, ideal pra consulta esporádica.

Redshift Spectrum é a ponte: dado quente no cluster, dado histórico no S3, uma query cobrindo os dois. É a resposta clássica para "manter anos de histórico consultável sem inflar o cluster".

Redshift não é banco transacional: se o enunciado fala em muitas escritas pequenas e concorrentes, é RDS/Aurora ou DynamoDB.

Sinais de prova

  • "Data warehouse / BI / OLAP / relatório analítico" → Redshift
  • "Consultar histórico no S3 sem carregar no cluster" → Redshift Spectrum
  • "Pico de concorrência em horário de relatório" → Concurrency Scaling
  • "Uso imprevisível, não quero dimensionar cluster" → Redshift Serverless
  • "Escalar armazenamento sem escalar compute" → RA3
  • "Query lenta e desbalanceada entre nós" → DISTKEY mal escolhida (data skew)
  • "DR do data warehouse" → snapshot cross-region
  • "Muitas transações pequenas" → não é Redshift

Relacionado


Parte de 09 - MOC Dados Analytics e ML · Documentação AWS

Buscar

Busca por título, seção e texto das notas