Zkuste nás kontaktovat
 Doba trvání 35 hodiny

Návrh Školení

Úvod, cíle a migrační strategie

  • Cíle kurzu, soulad profilu účastníků a kritéria úspěchu
  • Obecné přístupy k migraci a zvažení rizik
  • Nastavení workspace, repozitářů a laboratorních datových sad

Den 1 — Zásady migrace a architektura

  • Koncepty Lakehouse, přehled Delta Lake a architektura Databricks
  • Rozdíly mezi SMP a MPP a jejich důsledky pro migraci
  • Design Medailonového systému (Bronze→Silver→Gold) a přehled Unity Catalog

Laboratorní úkol 1 — Překlad uložené procedury

  • Praktická migrace ukázkové uložené procedury do notebooku
  • Mapování dočasných tabulek a kurzorů na transformace DataFrame
  • Validace a srovnání s původním výstupem

Den 2 — Pokročilé Delta Lake a přírůstkové načítání

  • ACID transakce, commit logy, verzování a time travel
  • Auto Loader, vzorce MERGE INTO, upserty a evoluce schémat
  • OPTIMIZE, VACUUM, Z-ORDER, partitionování a ladení úložiště

Laboratorní úkol 2 — Přírůstková ingestí a optimalizace

  • Implementace ingestí pomocí Auto Loader a workflowů MERGE
  • Aplikace OPTIMIZE, Z-ORDER a VACUUM; validace výsledků
  • Měření zlepšení výkonu čtení/zapisování

Den 3 — SQL v Databricks, výkon a ladění

  • Analytické funkce SQL: okenní funkce, funkce vyššího řádu, zpracování JSON/pole
  • Čtení Spark UI, DAG, shuffles, stage, tasky a diagnostika láhveých hrdel
  • Vzorce ladění dotazů: broadcast joiny, hinty, caching a redukce spill

Laboratorní úkol 3 — Refaktoring SQL a ladění výkonu

  • Refaktorování náročné SQL procedury do optimalizovaného Spark SQL
  • Použití tras Spark UI pro identifikaci a opravu skew a shuffle problémů
  • Benchmark před/po a dokumentace kroků ladění

Den 4 — Praktický PySpark: Nahrazení procedurální logiky

  • Model provádění Sparku: driver, executors, lazy evaluation a strategie partitionování
  • Transformace smyček a kurzorů do vektorizovaných operací DataFrame
  • Modularizace, UDF/pandas UDF, widgety a znovu využitelné knihovny

Laboratorní úkol 4 — Refaktoring procedurálních skriptů

  • Refaktorování procedurálního ETL skriptu do modulárních PySpark notebooků
  • Zavedení parametrizace, unit testů a znovu využitelných funkcí
  • Kódová revize a aplikace kontrolního seznamu nejlepších praktik

Den 5 — Orcheestrace, end-to-end potrubí a nejlepší praktiky

  • Databricks Workflows: návrh úloh, závislosti úloh, trigger a zpracování chyb
  • Návrh přírůstkových Medailonových potrubí s pravidly kvality a validací schémat
  • Integrace s Git (GitHub/Azure DevOps), CI a testovací strategie pro PySpark logiku

Laboratorní úkol 5 — Vytvoření kompletního end-to-end potrubí

  • Sestavení potrubí Bronze→Silver→Gold orchestrovaného pomocí Workflows
  • Implementace logování, auditu, opakování a automatizované validace
  • Spuštění celého potrubí, validace výstupů a příprava poznámek ke spuštění

Operationalizace, správa a připravenost pro produkci

  • Správa Unity Catalog, linie a přístupová oprávnění nejlepší praktiky
  • Náklady, velikost clusteru, autoscaling a vzorce současných úloh
  • Kontrolní seznamy nasazení, strategie rollbacks a tvorba runbook

Finální přezkum, přenos znalostí a další kroky

  • Přezentace migrace a přínosů ze strany účastníků
  • Analýza chyb, doporučené následné aktivity a předání učebních materiálů
  • Reference, cesty dalšího učení a možnosti podpory

Požadavky

  • Pochopení konceptů datového inženýrství
  • Zkušenosti se SQL a uloženými procedurami (Synapse / SQL Server)
  • Známost konceptů ETL orchestrace (ADF nebo podobné)

Publikum

  • Tehnologičtí manažeři se zkušenostmi v datovém inženýrství
  • Data inženýři přecházející od procedurální OLAP logiky k Lakehouse vzorcům
  • Platformní inženýři odpovědní za nasazení Databricks

Počet účastníků


Cena za účastníka

Nadcházející kurzy

Související kategorie