Návrh Školení
PySpark a strojové učení /
Modul 1: Velká data a základy Sparku
- Přehled ekosystému velkých dat a role Sparku v moderních datových platformách
- Architektura Sparku: komponenty jako driver, exekutoři a správce clusterů; princip lazárního vyhodnocování, koncept DAG a plánování provádění
- Rozdíly mezi API typu RDD a DataFrame – kdy použít které z nich
- Vytvoření a konfigurace objektu SparkSession, pochopení základních parametrů nastavení aplikace
Modul 2: Datové rámce v PySpark
- Načítání a ukládání dat z firemních zdrojů v různých formátech (CSV, JSON, Parquet, Delta)
- Práce s datovými rámci v PySpark: transformace, akce, výrazy na sloupcích, filtrování, spojování a agregace
- Implementace pokročilých operací – okenní funkce, práce s časovými údaji a hierarchickými strukturami dat
- Kontrola kvality dat a tvorba přehledného, udržitelného kódu v PySpark
Modul 3: Efektivní zpracování velkých datových souborů
- Základy výkonu Sparku – strategie rozdělování dat, chování operace shuffle, využití mezipaměti a trvalého ukládání
- Používání technik optimalizace – např. broadcast spojení nebo analýza plánu provádění
- Efektivní práce s rozsáhlými datovými soubory a osvědčené postupy při navrhování škálovatelných datových procesů
- Evoluce schémat dat a moderní formáty ukládání používané v podnikovém prostředí
Modul 4: Tvorba prediktivních proměnných ve velkém měřítku
- Práce s nástrojem Spark MLlib při tvorbě prediktivních proměnných – vyplňování chybějících hodnot, kódování kategorických dat a škálování atributů
- Návrh opakovaně využitelných kroků předzpracování a příprava dat pro budoucí použití v modelech strojového učení
- Úvod do výběru prediktivních proměnných a způsoby řešení problémů s nerovnoměrným rozložením dat
Modul 5: Strojové učení pomocí Spark MLlib
- Architektura nástroje MLlib a principy konstrukce Estimatorů a Transformerů
- Trénování regresních a klasifikačních modelů ve velkém měřítku – například lineární regrese, logistická regrese, rozhodovací stromy či náhodné lesy
- Porovnávání různých modelů a interpretace výsledků v kontextu distribuovaného učení
Modul 6: Kompletní ML pipeline
- Konstrukce end-to-end pracovních postupů strojového učení zahrnujících kroky předzpracování, tvorbu prediktivních proměnných a trénování modelů
- Aplikace strategií rozdělení dat na trénovací, validační a testovací části
- Provádění křížové validace a optimalizace hyperparametrů pomocí metod typu grid search nebo náhodný výběr
- Organizace opakovaně proveditelných experimentů v oblasti strojového učení
Modul 7: Hodnocení modelů a praktické rozhodování při jejich výběru
- Použití vhodných metrik pro hodnocení regresních i klasifikačních modelů
- Rozpoznávání nadměrného a nedostatečného přizpůsobení modelu datům, rozhodování o vhodnosti konkrétních modelů
- Interpretace významu jednotlivých prediktivních proměnných a pochopení chování modelů
Modul 8: Produkční využití a firemní postupy
- Ukládání a načítání modelů v rámci prostředí Sparku
- Konstrukce dávkových procesů pro inferenci na velkých množstvích dat
- Pochopení celého životního cyklu modelů strojového učení v podnikovém prostředí
- Seznámení s verzováním, metodami sledování experimentů a základními strategiemi testování
Praktické výstupy školení
- Schopnost samostatné práce s nástrojem PySpark
- Možnost efektivního zpracování velkých množství dat
- Schopnost vytvářet prediktivní proměnné i ve velmi rozsáhlých datech
- Možnost konstruovat škálovatelné pracovní postupy pro strojové učení
Požadavky
Účastníci by měli mít následující znalosti:
Základní dovednosti v programování v Pythonu – práce s funkcemi, datovými strukturami a knihovnami
Elementární znalosti konceptů analýzy dat jako jsou datové soubory, transformace a agregace
Základní povědomí o SQL a principech relačních databází
Orientaci v základních konceptech strojového učení – trénovací data, prediktivní proměnné a hodnotící metriky
Je vhodné mít také seznámenost s prostředím příkazového řádku a základními postupy vývoje softwaru
Zkušenosti s knihovnami typu Pandas, NumPy či podobnými nástroji pro zpracování dat jsou užitečné, ale nejsou nutné.
Reference (1)
Líbilo se mi, že to bylo praktické. Miloval jsem aplikovat teoretické znalosti na praktické příklady.
Aurelia-Adriana - Allianz Services Romania
Kurz - Python and Spark for Big Data (PySpark)
Přeloženo strojem