Zkuste nás kontaktovat

Návrh Školení

Základy platformy Databricks a konceptu Lakehouse

  • Architektura a komponenty Databricks Lakehouse
  • Organizace pracovních prostorů a katalogů

Pracovní prostor a sešity v Databricks

  • Orientace v pracovním prostoru a vývoj založený na sešitech
  • Strukturování kódu do znovu použitelných sešitů

Architektura a běh Apache Sparku

  • Architektura runtime prostředí Sparku a model provedení
  • Líné vyhodnocování (lazy evaluation) a DAG úloh

DataFrames v PySparku a DataFrame API

  • Abstrakce DataFrames a schémata
  • Základní operace na DataFrame a výrazy sloupců

Převod SQL na DataFrames v PySparku

  • Překládání základních klauzulí SQL na operace DataFrame
  • Okenní funkce a agregace v PySparku

Čtení a zápis dat v Databricks

  • Čtení ze běžných zdrojů souborů a databází
  • Zápis a partitioning dat v Lakehouse

Delta Lake a správa tabulek

  • Delta tabulky a transakce ACID
  • Time travel a evoluace schématu

Vzorce pro čištění a transformaci dat

  • Čištění dat a konverze typů
  • Tvorba znovu použitelné transformační logiky

Uživatelsky definované funkce (UDF) a modulární kód

  • Python UDFs a pandas UDFs
  • Modularizace procedurální logiky do funkcí

Tuning výkonu a optimalizace

  • Strategie partitioningu a cachování
  • Diagnostika úzkých míst pomocí Spark UI

Základy Structured Streaming

  • Srovnání modelů batch a streaming processingu
  • Streaming DataFrames a základní agregace

Úlohy a orchestrování pracovních postupů v Databricks

  • Naplánování sešitů jako úloh a tasks
  • Tvorba vícekrokových pracovních postupů s závislostmi

Unity Catalog a správa dat (Data Governance)

  • Architektura Unity Catalogu a jmenné prostory
  • Ovládání přístupu a sledování původu dat (lineage)

Testování, ladění a best practices pro produkční prostředí

  • Unit testing logiky v PySparku
  • Ladění a standardy kvality kódu

Příklady z finančního sektoru - end-to-end use cases

  • Tvorba kompletního ETL procesu pro bankovnictví
  • Převod legacy SQL procesů na PySpark

Migrace SQL zátěží do PySparku

  • Strategie migrace a plánovací vzorce
  • Inkrementální převod pracovních postupů SQL na PySpark

Požadavky

  • Zkušenosti s programováním v Pythonu, včetně funkcí a datových typů
  • Porozumění jazyku SQL, včetně spojování tabulek (joins), agregací a poddotazů (subqueries)
  • Předchozí zkušenost s Databricks nebo PySparkem není vyžadována

Cílová skupina

  • Datoví inženýři, datoví analytici a odborníci v oblasti dat
  • Týmy migrující existující pracovní postupy založené na SQL do Databricks a PySparku
 35 Hodiny

Počet účastníků


Cena za účastníka

Reference (1)

Nadcházející kurzy

Související kategorie