trilha

AWS SAA-C03/09 - Dados Analytics e ML2 min

Athena e Glue

Perguntas-guia

Responda com suas palavras antes de ler o resto da nota.

  • Que problema isso resolve?
  • Quando usar / quando NÃO usar?
  • Qual o principal trade-off (custo, latência, operação)?
  • Que sinal no enunciado aponta pra isso?
  • Com o que isso é confundido na prova?

Conceito

A dupla que transforma o S3 num data lake consultável sem servidor nenhum.

Athena

Consulta SQL direto sobre arquivos no S3 (Presto/Trino por baixo). Sem cluster, sem carga prévia, sem infraestrutura.

  • Cobrança: por TB escaneado (~$5/TB). Query que não escaneia nada custa nada.
  • Formatos: CSV, JSON, Parquet, ORC, Avro, logs do ELB/CloudTrail/VPC Flow.
  • Resultado vai pra um bucket S3 de output.
  • Athena Federated Query consulta fontes externas (RDS, DynamoDB, on-premises) via conector Lambda.
  • Workgroups separam times, aplicam limite de dados escaneados e isolam custo.

Glue

ETL serverless com três peças que caem separadas:

Peça Função
Data Catalog Metastore central (schema das tabelas). Usado por Athena, Redshift Spectrum, EMR
Crawler Varre o S3, infere schema e partições e popula o Catalog
Glue Jobs ETL em Spark (ou Python shell)
Glue DataBrew Preparação visual de dados, sem código
Glue Studio Editor visual de pipeline

Trade-offs

A questão de custo que sempre cai

Como Athena cobra por TB escaneado, a resposta pra "reduzir custo de consulta no S3" é sempre a mesma combinação:

  1. Formato colunar (Parquet/ORC) — lê só as colunas necessárias
  2. Particionamento (s3://bucket/ano=2026/mes=08/) — lê só as partições filtradas
  3. Compressão (Snappy, GZIP)
  4. Arquivos maiores (evitar milhões de arquivos pequenos)

Juntas, cortam o custo em ordem de grandeza.

Athena é serverless e não é rápido pra tudo: query analítica pesada e recorrente, com muitos JOINs e alta concorrência, roda melhor no Redshift. Athena ganha em consulta esporádica, exploração e log — onde manter um cluster ligado seria desperdício.

Glue Crawler automatiza a descoberta de schema e cobra por execução; em schema estável, criar a tabela manualmente é mais barato.

Sinais de prova

  • "Consultar dados no S3 com SQL, sem infraestrutura" → Athena
  • "Reduzir custo das consultas do Athena" → Parquet + particionamento + compressão
  • "Analisar logs do CloudTrail / VPC Flow Logs / ELB" → Athena
  • "Descobrir schema automaticamente" → Glue Crawler
  • "ETL sem gerenciar servidor" → Glue Jobs
  • "Preparar dados sem escrever código" → Glue DataBrew
  • "Limitar quanto cada time pode escanear" → Athena Workgroups
  • "BI recorrente, alta concorrência, JOIN complexo" → Redshift, não Athena

Relacionado


Parte de 09 - MOC Dados Analytics e ML · Documentação AWS

Buscar

Busca por título, seção e texto das notas