Zkuste nás kontaktovat

Návrh Školení

Úvod:

  • Apache Spark v rámci ekosystému Hadoop
  • Stručný úvod do Pythonu a Scala

Teoretické základy:

  • Architektura Apache Sparku
  • RDD – rezidentní distribuované datové soubory
  • Transformace a akce v rámci zpracování dat
  • Fáze, úlohy a jejich vzájemné závislosti

Praktické cvičení v prostředí Databricks – osvojení si základů:

  • Cvičení s využitím rozhraní RDD API
  • Základní funkce pro transformace a akce
  • Použití struktury PairRDD
  • Funkce spojování dat – Join
  • Strategie ukládání dat do mezipaměti
  • Cvičení s rozhraním DataFrame API
  • Použití nástroje SparkSQL
  • Ovládání DataFrame – výběr, filtrování, seskupování a řazení dat
  • Vytváření vlastních funkcí – UDF (User Defined Functions)
  • Přehled rozhraní DataSet API
  • Zpracování dat v reálném čase – Streaming

Praktické cvičení v prostředí AWS – pochopení procesu nasazení:

  • Základy služby AWS Glue
  • Rozdíly mezi AWS EMR a AWS Glue
  • Příklady úloh spouštěných v obou prostředích
  • Výhody a nevýhody jednotlivých řešení

Doplňující informace:

  • Úvod do orchestrace úloh pomocí Apache Airflow

Požadavky

Programátorské dovednosti (nejlépe v Pythonu nebo Scala)

Základy SQL

 21 Hodiny

Počet účastníků


Cena za účastníka

Reference (3)

Nadcházející kurzy

Související kategorie