AWS SAA-C03/09 - Dados Analytics e ML2 min
QuickSight e Data Firehose
Responda com suas palavras antes de ler o resto da nota.
- Que problema isso resolve?
- Quando usar / quando NÃO usar?
- Qual o principal trade-off (custo, latência, operação)?
- Que sinal no enunciado aponta pra isso?
- Com o que isso é confundido na prova?
Conceito
As duas pontas do pipeline analítico: como o dado chega e como o negócio enxerga.
Data Firehose (ex-Kinesis Data Firehose)
Entrega near real-time de streaming para destino, sem servidor e sem código.
| Característica | Detalhe |
|---|---|
| Destinos | S3, Redshift, OpenSearch, Splunk, endpoint HTTP |
| Buffer | Por tamanho (MB) ou tempo (mín. ~60 s) |
| Transformação | Lambda no caminho |
| Conversão de formato | JSON → Parquet / ORC (barateia o Athena depois) |
| Retenção / replay | Nenhuma — entrega e descarta |
| Escala | Automática |
É o caminho mais curto entre "estou gerando eventos" e "os eventos estão no data lake".
QuickSight
BI serverless: dashboards e visualizações para o time de negócio.
| Recurso | O que é |
|---|---|
| SPICE | Engine em memória que acelera a consulta e desacopla da fonte |
| Fontes | Redshift, Athena, RDS, S3, Aurora, OpenSearch, arquivos, SaaS |
| ML Insights | Detecção de anomalia, previsão e narrativa automática |
| Embedded analytics | Dashboard embutido na sua aplicação |
| Row-Level Security | Cada usuário vê só as linhas que lhe cabem |
| Q | Pergunta em linguagem natural |
Cobrança por usuário (Author / Reader), não por servidor.
Trade-offs
Firehose troca controle por simplicidade: você não gerencia shard, mas também não pode reprocessar nem ter múltiplos consumidores independentes. Quando o enunciado menciona replay ou vários consumidores do mesmo stream, a resposta é Kinesis Data Streams.
O buffer mínimo faz dele near real-time. Se o requisito é latência de milissegundos, Firehose não atende.
QuickSight com SPICE tira carga da fonte e serve dashboard rápido, ao custo de o dado ser um retrato do último refresh — dashboard "ao vivo" exige consulta direta, mais lenta e mais cara.
Sinais de prova
- "Entregar streaming no S3 sem escrever código" → Firehose
- "Converter para Parquet a caminho do data lake" → Firehose + conversão de formato
- "Carregar stream em Redshift / OpenSearch / Splunk" → Firehose
- "Precisa reprocessar ou ter vários consumidores" → Data Streams, não Firehose
- "Dashboard de BI para a área de negócio" → QuickSight
- "Cada gerente vê só a região dele" → Row-Level Security
- "Acelerar dashboard sem sobrecarregar o Redshift" → SPICE
- "Dashboard dentro do meu produto SaaS" → embedded analytics
Relacionado
Parte de 09 - MOC Dados Analytics e ML · Documentação AWS