Zkuste nás kontaktovat

Návrh Školení

Úvod do Apache Airflow

  • Co je to orchestrace pracovních postupů?
  • Hlavní vlastnosti a výhody Apache Airflow
  • Vylepšení ve verzi 2.x a přehled ekosystému

Architektura a základní koncepty

  • Scheduler, webový server a procesy pracující v pozadí
  • DAGy, úkoly a operátory
  • Exekutoři a backendy (Local, Celery, Kubernetes)

Instalace a nastavení

  • Instalace Airflow v místním prostředí i na cloudu
  • Konfigurace s různými exekutory
  • Nastavení databází pro ukládání metadat a připojení k externím zdrojům

Práce s webovým rozhraním a příkazovou řádkou Airflow

  • Prozkoumání webového interfejsu Airflow
  • Monitorování průběhu DAGů, jednotlivých úkolů a jejich protokolů
  • Použití příkazové řádky Airflow k správě systému

Tvorba a správa DAGů

  • Vytváření DAGů pomocí rozhraní TaskFlow API
  • Práce s operátory, senzory a propojovacími prvky
  • Správa závislostí a intervalů plánování úkolů

Integrace s datovými zdroji a cloudovými službami

  • Připojení k databázím, API rozhraním a frontám zpráv
  • Provádění ETL kanálů v rámci Airflow
  • Integrace s cloudovými platformami: operátory pro AWS, GCP a Azure

Monitorování a sledování systému

  • Protokoly úkolů a jejich okamžitá kontrola
  • Sběr metrik pomocí nástrojů Prometheus a Grafana
  • Odesílání upozornění prostřednictvím e-mailu nebo Slacku

Zabezpečení Apache Airflow

  • Řízení přístupu na základě rolí (RBAC)
  • Autentizace pomocí LDAP, OAuth a SSO
  • Bezpečné ukládání citlivých dat s využitím nástrojů typu Vault nebo cloudových úložišť tajemství

Škálování Apache Airflow

  • Řešení pro paralelní zpracování, správu souběžnosti a řízení úkolů ve frontách
  • Využití CeleryExecutor a KubernetesExecutor
  • Nasazení Airflow na platformu Kubernetes pomocí nástroje Helm

Osvědčené postupy pro produkční prostředí

  • Správa verzí a automatizace nasazení DAGů pomocí CI/CD
  • Testování a ladění vytvořených DAGů
  • Udržování spolehlivosti a výkonu systému při rostoucím objemu dat

Odstraňování problémů a optimalizace

  • Diagnostika chybně fungujících DAGů a jednotlivých úkolů
  • Optimalizace výkonu vytvořených pracovních postupů
  • Časté chyby a způsoby, jak se jim vyhnout

Závěrečné shrnutí a další kroky

Požadavky

  • Zkušenosti s programováním v Pythonu
  • Znalost konceptů datového inženýrství nebo DevOps
  • Přehled o procesech ETL a orchestraci pracovních postupů

Cílová skupina

  • Datoví vědci
  • Datoví inženýři
  • DevOps a infrastrukturní inženýři
  • Softwaroví vývojáři
 21 Hodiny

Počet účastníků


Cena za účastníka

Reference (7)

Nadcházející kurzy

Související kategorie