Zkuste nás kontaktovat

Návrh Školení

Úvod, cíle a strategie migrace

  • Cíle kurzu, shoda profilu účastníků a kritéria úspěchu
  • Přehled přístupů k migraci a zvažení rizik
  • Nastavení workspace, repozitářů a laboratorních datových sad

Den 1 — Základy migrace a architektura

  • Koncepty Lakehouse, přehled Delta Lake a architektura Databricks
  • Rozdíly mezi SMP a MPP a jejich dopady na migraci
  • Design vzoru Medallion (Bronze→Silver→Gold) a přehled Unity Catalog

Laboratorní úloha dne 1 — Překlad uložené procedury

  • Praktická migrace ukázkové uložené procedury do notebooku
  • Přemapování dočasných tabulek a kurzorů na transformace DataFrame
  • Ověření a srovnání s původním výstupem

Den 2 — Pokročilý Delta Lake a inkrementální načítání

  • ACID transakce, commit logy, verzování a časové cestování (time travel)
  • Auto Loader, vzorce MERGE INTO, upserty a evoluce schématu
  • OPTIMIZE, VACUUM, Z-ORDER, partitioning a ladění úložiště

Laboratorní úloha dne 2 — Inkrementální načítání a optimalizace

  • Implementace načítání pomocí Auto Loader a workflow MERGE
  • Použití OPTIMIZE, Z-ORDER a VACUUM; validace výsledků
  • Měření zlepšení výkonu čtení/zápisu

Den 3 — SQL v Databricks, výkon a ladění (debugging)

  • Analytické funkce SQL: okenní funkce, vyšší řádové funkce, zpracování JSON/polí (arrays)
  • Čtení Spark UI, DAG, shuffles, stages, tasks a diagnostika láhve (bottlenecks)
  • Vzorce ladění dotazů: broadcast joins, hinty, cacheování a redukce spillu

Laboratorní úloha dne 3 — Refaktorace SQL a ladění výkonu

  • Refaktorace náročné SQL procedury do optimalizovaného Spark SQL
  • Použití stop Spark UI k identifikaci a opravě problémů se skosem (skew) a shuffle
  • Benchmarking před a po změnách a dokumentace kroků ladění

Den 4 — Praktický PySpark: Nahrazení procedurální logiky

  • Model spuštění Spark: driver, executors, líné vyhodnocování (lazy evaluation) a strategie partitioning
  • Transformace smyček a kurzorů na vektorizované operace DataFrame
  • Modularizace, UDF/pandas UDF, widgety a znovu použitelné knihovny

Laboratorní úloha dne 4 — Refaktorace procedurálních skriptů

  • Refaktorace procedurálního ETL skriptu na modularizované notebooky PySpark
  • Zavedení parametrizace, testů ve stylu unit testů a znovu použitelných funkcí
  • Kód review a aplikace kontrolního seznamu nejlepších praktik

Den 5 — Orchestrace, kompletní pipeline a nejlepše praktiky

  • Databricks Workflows: design jobů, závislosti úloh, spouštěče (triggers) a zpracování chyb
  • Design inkrementálních pipeline Medallion s pravidly kvality a validací schématu
  • Integrace s Git (GitHub/Azure DevOps), CI a strategie testování logiky PySpark

Laboratorní úloha dne 5 — Vytvoření kompletní pipeline od začátku do konce

  • Sestavení pipeline Bronze→Silver→Gold orchestrované pomocí Workflows
  • Implementace logování, auditu, opakování (retries) a automatických validací
  • Spuštění celé pipeline, validace výstupů a příprava poznámek k nasazení

Operacionalizace, správa (governance) a připravenost pro produkci

  • Nejlepší praktiky správy (governance) pomocí Unity Catalog, sledování původu (lineage) a přístupových oprávnění
  • Náklady, velikost klastrů, autoscaling a vzorce konkurence jobů
  • Kontrolní seznamy nasazení, strategie vrácení (rollback) a tvorba runbooků

Finální shrnutí, převod znalostí a další kroky

  • Přednášky účastníků o migrační práci a získaných zkušenostech
  • Analýza mezer, doporučené následné aktivity a předání výukových materiálů
  • Odkazy, cesty dalšího učení a možnosti podpory

Požadavky

  • Pochopení konceptů datového inženýrství
  • Zkušenosti s SQL a uloženými procedurami (Synapse / SQL Server)
  • Znalost konceptů orchestrace ETL (ADF nebo podobné)

Publikum

  • Technologičtí manažeři s pozadím v datovém inženýrství
  • Data inženýři přecházející od procedurální logiky OLAP k vzorům Lakehouse
  • Platformní inženýři odpovědní za nasazení Databricks
 35 Hodiny

Počet účastníků


Cena za účastníka

Nadcházející kurzy

Související kategorie