Zkuste nás kontaktovat

Návrh Školení

PySpark a strojové učení /

Modul 1: Velká data a základy Sparku

  • Přehled ekosystému velkých dat a role Sparku v moderních datových platformách
  • Architektura Sparku: komponenty jako driver, exekutoři a správce clusterů; princip lazárního vyhodnocování, koncept DAG a plánování provádění
  • Rozdíly mezi API typu RDD a DataFrame – kdy použít které z nich
  • Vytvoření a konfigurace objektu SparkSession, pochopení základních parametrů nastavení aplikace

Modul 2: Datové rámce v PySpark

  • Načítání a ukládání dat z firemních zdrojů v různých formátech (CSV, JSON, Parquet, Delta)
  • Práce s datovými rámci v PySpark: transformace, akce, výrazy na sloupcích, filtrování, spojování a agregace
  • Implementace pokročilých operací – okenní funkce, práce s časovými údaji a hierarchickými strukturami dat
  • Kontrola kvality dat a tvorba přehledného, udržitelného kódu v PySpark

Modul 3: Efektivní zpracování velkých datových souborů

  • Základy výkonu Sparku – strategie rozdělování dat, chování operace shuffle, využití mezipaměti a trvalého ukládání
  • Používání technik optimalizace – např. broadcast spojení nebo analýza plánu provádění
  • Efektivní práce s rozsáhlými datovými soubory a osvědčené postupy při navrhování škálovatelných datových procesů
  • Evoluce schémat dat a moderní formáty ukládání používané v podnikovém prostředí

Modul 4: Tvorba prediktivních proměnných ve velkém měřítku

  • Práce s nástrojem Spark MLlib při tvorbě prediktivních proměnných – vyplňování chybějících hodnot, kódování kategorických dat a škálování atributů
  • Návrh opakovaně využitelných kroků předzpracování a příprava dat pro budoucí použití v modelech strojového učení
  • Úvod do výběru prediktivních proměnných a způsoby řešení problémů s nerovnoměrným rozložením dat

Modul 5: Strojové učení pomocí Spark MLlib

  • Architektura nástroje MLlib a principy konstrukce Estimatorů a Transformerů
  • Trénování regresních a klasifikačních modelů ve velkém měřítku – například lineární regrese, logistická regrese, rozhodovací stromy či náhodné lesy
  • Porovnávání různých modelů a interpretace výsledků v kontextu distribuovaného učení

Modul 6: Kompletní ML pipeline

  • Konstrukce end-to-end pracovních postupů strojového učení zahrnujících kroky předzpracování, tvorbu prediktivních proměnných a trénování modelů
  • Aplikace strategií rozdělení dat na trénovací, validační a testovací části
  • Provádění křížové validace a optimalizace hyperparametrů pomocí metod typu grid search nebo náhodný výběr
  • Organizace opakovaně proveditelných experimentů v oblasti strojového učení

Modul 7: Hodnocení modelů a praktické rozhodování při jejich výběru

  • Použití vhodných metrik pro hodnocení regresních i klasifikačních modelů
  • Rozpoznávání nadměrného a nedostatečného přizpůsobení modelu datům, rozhodování o vhodnosti konkrétních modelů
  • Interpretace významu jednotlivých prediktivních proměnných a pochopení chování modelů

Modul 8: Produkční využití a firemní postupy

  • Ukládání a načítání modelů v rámci prostředí Sparku
  • Konstrukce dávkových procesů pro inferenci na velkých množstvích dat
  • Pochopení celého životního cyklu modelů strojového učení v podnikovém prostředí
  • Seznámení s verzováním, metodami sledování experimentů a základními strategiemi testování

 

Praktické výstupy školení

  • Schopnost samostatné práce s nástrojem PySpark
  • Možnost efektivního zpracování velkých množství dat
  • Schopnost vytvářet prediktivní proměnné i ve velmi rozsáhlých datech
  • Možnost konstruovat škálovatelné pracovní postupy pro strojové učení

Požadavky

Účastníci by měli mít následující znalosti:

Základní dovednosti v programování v Pythonu – práce s funkcemi, datovými strukturami a knihovnami
Elementární znalosti konceptů analýzy dat jako jsou datové soubory, transformace a agregace
Základní povědomí o SQL a principech relačních databází
Orientaci v základních konceptech strojového učení – trénovací data, prediktivní proměnné a hodnotící metriky
Je vhodné mít také seznámenost s prostředím příkazového řádku a základními postupy vývoje softwaru

Zkušenosti s knihovnami typu Pandas, NumPy či podobnými nástroji pro zpracování dat jsou užitečné, ale nejsou nutné.

 21 Hodiny

Počet účastníků


Cena za účastníka

Reference (1)

Nadcházející kurzy

Související kategorie