Návrh Školení
Základy platformy Databricks a konceptu Lakehouse
- Architektura a komponenty Databricks Lakehouse
- Organizace pracovních prostorů a katalogů
Pracovní prostor a sešity v Databricks
- Orientace v pracovním prostoru a vývoj založený na sešitech
- Strukturování kódu do znovu použitelných sešitů
Architektura a běh Apache Sparku
- Architektura runtime prostředí Sparku a model provedení
- Líné vyhodnocování (lazy evaluation) a DAG úloh
DataFrames v PySparku a DataFrame API
- Abstrakce DataFrames a schémata
- Základní operace na DataFrame a výrazy sloupců
Převod SQL na DataFrames v PySparku
- Překládání základních klauzulí SQL na operace DataFrame
- Okenní funkce a agregace v PySparku
Čtení a zápis dat v Databricks
- Čtení ze běžných zdrojů souborů a databází
- Zápis a partitioning dat v Lakehouse
Delta Lake a správa tabulek
- Delta tabulky a transakce ACID
- Time travel a evoluace schématu
Vzorce pro čištění a transformaci dat
- Čištění dat a konverze typů
- Tvorba znovu použitelné transformační logiky
Uživatelsky definované funkce (UDF) a modulární kód
- Python UDFs a pandas UDFs
- Modularizace procedurální logiky do funkcí
Tuning výkonu a optimalizace
- Strategie partitioningu a cachování
- Diagnostika úzkých míst pomocí Spark UI
Základy Structured Streaming
- Srovnání modelů batch a streaming processingu
- Streaming DataFrames a základní agregace
Úlohy a orchestrování pracovních postupů v Databricks
- Naplánování sešitů jako úloh a tasks
- Tvorba vícekrokových pracovních postupů s závislostmi
Unity Catalog a správa dat (Data Governance)
- Architektura Unity Catalogu a jmenné prostory
- Ovládání přístupu a sledování původu dat (lineage)
Testování, ladění a best practices pro produkční prostředí
- Unit testing logiky v PySparku
- Ladění a standardy kvality kódu
Příklady z finančního sektoru - end-to-end use cases
- Tvorba kompletního ETL procesu pro bankovnictví
- Převod legacy SQL procesů na PySpark
Migrace SQL zátěží do PySparku
- Strategie migrace a plánovací vzorce
- Inkrementální převod pracovních postupů SQL na PySpark
Požadavky
- Zkušenosti s programováním v Pythonu, včetně funkcí a datových typů
- Porozumění jazyku SQL, včetně spojování tabulek (joins), agregací a poddotazů (subqueries)
- Předchozí zkušenost s Databricks nebo PySparkem není vyžadována
Cílová skupina
- Datoví inženýři, datoví analytici a odborníci v oblasti dat
- Týmy migrující existující pracovní postupy založené na SQL do Databricks a PySparku
Reference (1)
Líbilo se mi, že to bylo praktické. Miloval jsem aplikovat teoretické znalosti na praktické příklady.
Aurelia-Adriana - Allianz Services Romania
Kurz - Python and Spark for Big Data (PySpark)
Přeloženo strojem