Děkujeme za vaši dotaz! Jeden z našich pracovníků vás brzy kontaktuje.
Děkujeme za rezervaci! Jeden z našich pracovníků vás brzy kontaktuje.
Návrh Školení
Úvod, cíle a strategie migrace
- Cíle kurzu, shoda profilu účastníků a kritéria úspěchu
- Přehled přístupů k migraci a zvažení rizik
- Nastavení workspace, repozitářů a laboratorních datových sad
Den 1 — Základy migrace a architektura
- Koncepty Lakehouse, přehled Delta Lake a architektura Databricks
- Rozdíly mezi SMP a MPP a jejich dopady na migraci
- Design vzoru Medallion (Bronze→Silver→Gold) a přehled Unity Catalog
Laboratorní úloha dne 1 — Překlad uložené procedury
- Praktická migrace ukázkové uložené procedury do notebooku
- Přemapování dočasných tabulek a kurzorů na transformace DataFrame
- Ověření a srovnání s původním výstupem
Den 2 — Pokročilý Delta Lake a inkrementální načítání
- ACID transakce, commit logy, verzování a časové cestování (time travel)
- Auto Loader, vzorce MERGE INTO, upserty a evoluce schématu
- OPTIMIZE, VACUUM, Z-ORDER, partitioning a ladění úložiště
Laboratorní úloha dne 2 — Inkrementální načítání a optimalizace
- Implementace načítání pomocí Auto Loader a workflow MERGE
- Použití OPTIMIZE, Z-ORDER a VACUUM; validace výsledků
- Měření zlepšení výkonu čtení/zápisu
Den 3 — SQL v Databricks, výkon a ladění (debugging)
- Analytické funkce SQL: okenní funkce, vyšší řádové funkce, zpracování JSON/polí (arrays)
- Čtení Spark UI, DAG, shuffles, stages, tasks a diagnostika láhve (bottlenecks)
- Vzorce ladění dotazů: broadcast joins, hinty, cacheování a redukce spillu
Laboratorní úloha dne 3 — Refaktorace SQL a ladění výkonu
- Refaktorace náročné SQL procedury do optimalizovaného Spark SQL
- Použití stop Spark UI k identifikaci a opravě problémů se skosem (skew) a shuffle
- Benchmarking před a po změnách a dokumentace kroků ladění
Den 4 — Praktický PySpark: Nahrazení procedurální logiky
- Model spuštění Spark: driver, executors, líné vyhodnocování (lazy evaluation) a strategie partitioning
- Transformace smyček a kurzorů na vektorizované operace DataFrame
- Modularizace, UDF/pandas UDF, widgety a znovu použitelné knihovny
Laboratorní úloha dne 4 — Refaktorace procedurálních skriptů
- Refaktorace procedurálního ETL skriptu na modularizované notebooky PySpark
- Zavedení parametrizace, testů ve stylu unit testů a znovu použitelných funkcí
- Kód review a aplikace kontrolního seznamu nejlepších praktik
Den 5 — Orchestrace, kompletní pipeline a nejlepše praktiky
- Databricks Workflows: design jobů, závislosti úloh, spouštěče (triggers) a zpracování chyb
- Design inkrementálních pipeline Medallion s pravidly kvality a validací schématu
- Integrace s Git (GitHub/Azure DevOps), CI a strategie testování logiky PySpark
Laboratorní úloha dne 5 — Vytvoření kompletní pipeline od začátku do konce
- Sestavení pipeline Bronze→Silver→Gold orchestrované pomocí Workflows
- Implementace logování, auditu, opakování (retries) a automatických validací
- Spuštění celé pipeline, validace výstupů a příprava poznámek k nasazení
Operacionalizace, správa (governance) a připravenost pro produkci
- Nejlepší praktiky správy (governance) pomocí Unity Catalog, sledování původu (lineage) a přístupových oprávnění
- Náklady, velikost klastrů, autoscaling a vzorce konkurence jobů
- Kontrolní seznamy nasazení, strategie vrácení (rollback) a tvorba runbooků
Finální shrnutí, převod znalostí a další kroky
- Přednášky účastníků o migrační práci a získaných zkušenostech
- Analýza mezer, doporučené následné aktivity a předání výukových materiálů
- Odkazy, cesty dalšího učení a možnosti podpory
Požadavky
- Pochopení konceptů datového inženýrství
- Zkušenosti s SQL a uloženými procedurami (Synapse / SQL Server)
- Znalost konceptů orchestrace ETL (ADF nebo podobné)
Publikum
- Technologičtí manažeři s pozadím v datovém inženýrství
- Data inženýři přecházející od procedurální logiky OLAP k vzorům Lakehouse
- Platformní inženýři odpovědní za nasazení Databricks
35 Hodiny