Found Description
PySpark e Spark (otimização, particionamento, tuning de jobs)
Ecossistema Cloudera/Databriks (Hive, Impala, HDFS, CML/CDSW)
SQL avançado e modelagem de dados (dimensional e analítica)
Python para engenharia (empacotamento, testes, logging, código produtivo)
Orquestração de pipelines (Airflow, Oozie ou similar)
MLOps: MLflow, versionamento de dados/modelos, monitoramento de drift
Git e esteiras de CI/CD
Noções sólidas de ML: ciclo de vida de modelos, feature engineering, avaliação
Diferencial: Kafka/streaming, conceitos de data mesh/lakehouse, APIs REST
Especialista em Ciência de Dados com foco em engenharia de dados. Responsável por desenhar, construir e otimizar pipelines de dados que alimentam modelos preditivos e aplicações de GenAI: ingestão, tratamento, feature stores, orquestração, versionamento e deploy em produção. Atua como referência técnica do time em arquitetura de dados, performance de processamen...