trilha

AWS SAA-C03/09 - Dados Analytics e ML2 min

EMR e OpenSearch

Perguntas-guia

Responda com suas palavras antes de ler o resto da nota.

  • Que problema isso resolve?
  • Quando usar / quando NÃO usar?
  • Qual o principal trade-off (custo, latência, operação)?
  • Que sinal no enunciado aponta pra isso?
  • Com o que isso é confundido na prova?

Conceito

Dois serviços gerenciados de propósitos bem distintos que aparecem no mesmo domínio da prova.

EMR — Elastic MapReduce

Cluster gerenciado de big data: Hadoop, Spark, Hive, HBase, Presto, Flink.

Tipo de nó Papel
Master Coordena o cluster
Core Processa e armazena (HDFS) — perder um core perde dado
Task Só processa — candidato ideal a Spot
  • EMRFS permite usar o S3 como storage em vez de HDFS, desacoplando compute de dado (o padrão moderno)
  • Cluster transitório sobe, roda o job e morre — economia grande em batch
  • EMR Serverless elimina o dimensionamento de cluster
  • Reduzir custo: Spot nos task nodes + cluster transitório + dado no S3

OpenSearch Service

Busca e análise (fork do Elasticsearch), com OpenSearch Dashboards (fork do Kibana).

Casos: análise de log e observabilidade, busca full-text em aplicação, análise em quase tempo real, detecção de anomalia.

Pipeline clássico:

Aplicação → CloudWatch Logs / Firehose → OpenSearch → Dashboards

UltraWarm e Cold storage guardam índices antigos no S3 por uma fração do custo do storage quente — resposta pra "reter logs por mais tempo com menor custo".

Trade-offs

EMR dá controle total do ecossistema Hadoop/Spark e transfere pra você o dimensionamento e o tuning. Quando o trabalho é ETL simples, Glue resolve o mesmo com menos operação; EMR ganha quando há framework específico, versão customizada, ou volume que justifica o cluster.

OpenSearch é excelente pra busca e log e não é um data warehouse: agregação analítica sobre histórico grande roda melhor no Redshift, e query SQL esporádica no S3 roda melhor no Athena. Ele também exige dimensionar nós e shards — não é serverless (embora exista o modo Serverless).

Sinais de prova

  • "Spark / Hadoop / Hive gerenciado" → EMR
  • "Reduzir custo do cluster de big data" → Spot nos task nodes + transitório
  • "Processar petabytes com framework open source" → EMR
  • "ETL simples sem gerenciar cluster" → Glue, não EMR
  • "Busca full-text na aplicação" → OpenSearch
  • "Análise e dashboard de logs" → OpenSearch + Dashboards
  • "Reter índices antigos com menor custo" → UltraWarm / Cold storage
  • "Detectar anomalia em métrica de log quase em tempo real" → OpenSearch

Relacionado


Parte de 09 - MOC Dados Analytics e ML · Documentação AWS

Buscar

Busca por título, seção e texto das notas