AWS SAA-C03/09 - Dados Analytics e ML2 min
EMR e OpenSearch
Responda com suas palavras antes de ler o resto da nota.
- Que problema isso resolve?
- Quando usar / quando NÃO usar?
- Qual o principal trade-off (custo, latência, operação)?
- Que sinal no enunciado aponta pra isso?
- Com o que isso é confundido na prova?
Conceito
Dois serviços gerenciados de propósitos bem distintos que aparecem no mesmo domínio da prova.
EMR — Elastic MapReduce
Cluster gerenciado de big data: Hadoop, Spark, Hive, HBase, Presto, Flink.
| Tipo de nó | Papel |
|---|---|
| Master | Coordena o cluster |
| Core | Processa e armazena (HDFS) — perder um core perde dado |
| Task | Só processa — candidato ideal a Spot |
- EMRFS permite usar o S3 como storage em vez de HDFS, desacoplando compute de dado (o padrão moderno)
- Cluster transitório sobe, roda o job e morre — economia grande em batch
- EMR Serverless elimina o dimensionamento de cluster
- Reduzir custo: Spot nos task nodes + cluster transitório + dado no S3
OpenSearch Service
Busca e análise (fork do Elasticsearch), com OpenSearch Dashboards (fork do Kibana).
Casos: análise de log e observabilidade, busca full-text em aplicação, análise em quase tempo real, detecção de anomalia.
Pipeline clássico:
Aplicação → CloudWatch Logs / Firehose → OpenSearch → Dashboards
UltraWarm e Cold storage guardam índices antigos no S3 por uma fração do custo do storage quente — resposta pra "reter logs por mais tempo com menor custo".
Trade-offs
EMR dá controle total do ecossistema Hadoop/Spark e transfere pra você o dimensionamento e o tuning. Quando o trabalho é ETL simples, Glue resolve o mesmo com menos operação; EMR ganha quando há framework específico, versão customizada, ou volume que justifica o cluster.
OpenSearch é excelente pra busca e log e não é um data warehouse: agregação analítica sobre histórico grande roda melhor no Redshift, e query SQL esporádica no S3 roda melhor no Athena. Ele também exige dimensionar nós e shards — não é serverless (embora exista o modo Serverless).
Sinais de prova
- "Spark / Hadoop / Hive gerenciado" → EMR
- "Reduzir custo do cluster de big data" → Spot nos task nodes + transitório
- "Processar petabytes com framework open source" → EMR
- "ETL simples sem gerenciar cluster" → Glue, não EMR
- "Busca full-text na aplicação" → OpenSearch
- "Análise e dashboard de logs" → OpenSearch + Dashboards
- "Reter índices antigos com menor custo" → UltraWarm / Cold storage
- "Detectar anomalia em métrica de log quase em tempo real" → OpenSearch
Relacionado
Parte de 09 - MOC Dados Analytics e ML · Documentação AWS