Formada em Sistemas de Informação pela UFS, participante da PyLadies Sergipe, pythonista e entusiasta da área de Dados. /mayaramachado /in/mayaramachado
origem. Ex.: ingestão e processamento de base de dados, consumo de APIs, geração de reportes, migração de dados. Pipeline de dados também são software com especificação para os diversos cenários de dados. Por isso, também podemos utilizar os conhecimentos da Engenharia de Software para desempenhar pipelines.
transformados no Postgres. O que faremos hoje Iremos explorar formas de orquestrar pipelines de ETL utilizando o Airflow. Definir a task de ingestão para consumir a API de Rick and Morty. Definir task para transformação usando PySpark.
processos incluem a copia de dados, transferência de dados armazenados na nuvem e combinação com outras fontes de dados. É uma terminologia mais geral que engloba ETL e outros tipos de processos de movimentação de dados. Data Pipeline Fonte Destino
agendamento e monitoração de workflows. Criada no AirBnb, o Airflow é uma ferramenta escrita em Python, que permite a criação de workflows a partir de Python scripts. Em 2016 se tornou um projeto da Apache Foundation.
integrar com outras ferramentas a partir do Airflow. Operadores É um tipo especial de Operador que aguarda algum trigger (interno ou externo) para iniciar a execução da task. Sensores Provém a interface com a qual os operadores utilizaram para se comunicar com serviços externos ao Airflow. Hooks
uma forma de passar valores entre tasks. Podem receber qualquer valor, mas atenção, não utilizar para grande quantidade de dados. Upstream e Downstream: define os relacionamentos entre as tasks. Podem ser definidos com set_upstream() e set_downstream() ou operadores << e >>. Variáveis: uma forma genérica de armazenar e obter valores e configurações no formato chave- valor. Connections: uma forma de armazenar credenciais utilizados na comunicação com serviços externos ao Airflow. Use Airflow + crypto para maior segurança no armazenamento de credenciais.
a API, as credenciais do Postgres e informação de conexão com o cluster Spark. Passos Definiremos o Operator que irá fazer as requisições HTTP, consumir a nossa Fonte. Definiremos o Operators para processar um job PySpark para transformação e carga. 1 2 3