Děkujeme za vaši dotaz! Jeden z našich pracovníků vás brzy kontaktuje.
Děkujeme za rezervaci! Jeden z našich pracovníků vás brzy kontaktuje.
Doba trvání 35 hodiny
Návrh Školení
Úvod, cíle a migrační strategie
- Cíle kurzu, soulad profilu účastníků a kritéria úspěchu
- Obecné přístupy k migraci a zvažení rizik
- Nastavení workspace, repozitářů a laboratorních datových sad
Den 1 — Zásady migrace a architektura
- Koncepty Lakehouse, přehled Delta Lake a architektura Databricks
- Rozdíly mezi SMP a MPP a jejich důsledky pro migraci
- Design Medailonového systému (Bronze→Silver→Gold) a přehled Unity Catalog
Laboratorní úkol 1 — Překlad uložené procedury
- Praktická migrace ukázkové uložené procedury do notebooku
- Mapování dočasných tabulek a kurzorů na transformace DataFrame
- Validace a srovnání s původním výstupem
Den 2 — Pokročilé Delta Lake a přírůstkové načítání
- ACID transakce, commit logy, verzování a time travel
- Auto Loader, vzorce MERGE INTO, upserty a evoluce schémat
- OPTIMIZE, VACUUM, Z-ORDER, partitionování a ladení úložiště
Laboratorní úkol 2 — Přírůstková ingestí a optimalizace
- Implementace ingestí pomocí Auto Loader a workflowů MERGE
- Aplikace OPTIMIZE, Z-ORDER a VACUUM; validace výsledků
- Měření zlepšení výkonu čtení/zapisování
Den 3 — SQL v Databricks, výkon a ladění
- Analytické funkce SQL: okenní funkce, funkce vyššího řádu, zpracování JSON/pole
- Čtení Spark UI, DAG, shuffles, stage, tasky a diagnostika láhveých hrdel
- Vzorce ladění dotazů: broadcast joiny, hinty, caching a redukce spill
Laboratorní úkol 3 — Refaktoring SQL a ladění výkonu
- Refaktorování náročné SQL procedury do optimalizovaného Spark SQL
- Použití tras Spark UI pro identifikaci a opravu skew a shuffle problémů
- Benchmark před/po a dokumentace kroků ladění
Den 4 — Praktický PySpark: Nahrazení procedurální logiky
- Model provádění Sparku: driver, executors, lazy evaluation a strategie partitionování
- Transformace smyček a kurzorů do vektorizovaných operací DataFrame
- Modularizace, UDF/pandas UDF, widgety a znovu využitelné knihovny
Laboratorní úkol 4 — Refaktoring procedurálních skriptů
- Refaktorování procedurálního ETL skriptu do modulárních PySpark notebooků
- Zavedení parametrizace, unit testů a znovu využitelných funkcí
- Kódová revize a aplikace kontrolního seznamu nejlepších praktik
Den 5 — Orcheestrace, end-to-end potrubí a nejlepší praktiky
- Databricks Workflows: návrh úloh, závislosti úloh, trigger a zpracování chyb
- Návrh přírůstkových Medailonových potrubí s pravidly kvality a validací schémat
- Integrace s Git (GitHub/Azure DevOps), CI a testovací strategie pro PySpark logiku
Laboratorní úkol 5 — Vytvoření kompletního end-to-end potrubí
- Sestavení potrubí Bronze→Silver→Gold orchestrovaného pomocí Workflows
- Implementace logování, auditu, opakování a automatizované validace
- Spuštění celého potrubí, validace výstupů a příprava poznámek ke spuštění
Operationalizace, správa a připravenost pro produkci
- Správa Unity Catalog, linie a přístupová oprávnění nejlepší praktiky
- Náklady, velikost clusteru, autoscaling a vzorce současných úloh
- Kontrolní seznamy nasazení, strategie rollbacks a tvorba runbook
Finální přezkum, přenos znalostí a další kroky
- Přezentace migrace a přínosů ze strany účastníků
- Analýza chyb, doporučené následné aktivity a předání učebních materiálů
- Reference, cesty dalšího učení a možnosti podpory
Požadavky
- Pochopení konceptů datového inženýrství
- Zkušenosti se SQL a uloženými procedurami (Synapse / SQL Server)
- Známost konceptů ETL orchestrace (ADF nebo podobné)
Publikum
- Tehnologičtí manažeři se zkušenostmi v datovém inženýrství
- Data inženýři přecházející od procedurální OLAP logiky k Lakehouse vzorcům
- Platformní inženýři odpovědní za nasazení Databricks