AWS SAA-C03/09 - Dados Analytics e ML2 min
Athena e Glue
Responda com suas palavras antes de ler o resto da nota.
- Que problema isso resolve?
- Quando usar / quando NÃO usar?
- Qual o principal trade-off (custo, latência, operação)?
- Que sinal no enunciado aponta pra isso?
- Com o que isso é confundido na prova?
Conceito
A dupla que transforma o S3 num data lake consultável sem servidor nenhum.
Athena
Consulta SQL direto sobre arquivos no S3 (Presto/Trino por baixo). Sem cluster, sem carga prévia, sem infraestrutura.
- Cobrança: por TB escaneado (~$5/TB). Query que não escaneia nada custa nada.
- Formatos: CSV, JSON, Parquet, ORC, Avro, logs do ELB/CloudTrail/VPC Flow.
- Resultado vai pra um bucket S3 de output.
- Athena Federated Query consulta fontes externas (RDS, DynamoDB, on-premises) via conector Lambda.
- Workgroups separam times, aplicam limite de dados escaneados e isolam custo.
Glue
ETL serverless com três peças que caem separadas:
| Peça | Função |
|---|---|
| Data Catalog | Metastore central (schema das tabelas). Usado por Athena, Redshift Spectrum, EMR |
| Crawler | Varre o S3, infere schema e partições e popula o Catalog |
| Glue Jobs | ETL em Spark (ou Python shell) |
| Glue DataBrew | Preparação visual de dados, sem código |
| Glue Studio | Editor visual de pipeline |
Trade-offs
Como Athena cobra por TB escaneado, a resposta pra "reduzir custo de consulta no S3" é sempre a mesma combinação:
- Formato colunar (Parquet/ORC) — lê só as colunas necessárias
- Particionamento (
s3://bucket/ano=2026/mes=08/) — lê só as partições filtradas - Compressão (Snappy, GZIP)
- Arquivos maiores (evitar milhões de arquivos pequenos)
Juntas, cortam o custo em ordem de grandeza.
Athena é serverless e não é rápido pra tudo: query analítica pesada e recorrente, com muitos JOINs e alta concorrência, roda melhor no Redshift. Athena ganha em consulta esporádica, exploração e log — onde manter um cluster ligado seria desperdício.
Glue Crawler automatiza a descoberta de schema e cobra por execução; em schema estável, criar a tabela manualmente é mais barato.
Sinais de prova
- "Consultar dados no S3 com SQL, sem infraestrutura" → Athena
- "Reduzir custo das consultas do Athena" → Parquet + particionamento + compressão
- "Analisar logs do CloudTrail / VPC Flow Logs / ELB" → Athena
- "Descobrir schema automaticamente" → Glue Crawler
- "ETL sem gerenciar servidor" → Glue Jobs
- "Preparar dados sem escrever código" → Glue DataBrew
- "Limitar quanto cada time pode escanear" → Athena Workgroups
- "BI recorrente, alta concorrência, JOIN complexo" → Redshift, não Athena
Relacionado
Parte de 09 - MOC Dados Analytics e ML · Documentação AWS