Děkujeme za vaši dotaz! Jeden z našich pracovníků vás brzy kontaktuje.
Děkujeme za rezervaci! Jeden z našich pracovníků vás brzy kontaktuje.
Návrh Školení
Úvod:
- Apache Spark v rámci ekosystému Hadoop
- Stručný úvod do Pythonu a Scala
Teoretické základy:
- Architektura Apache Sparku
- RDD – rezidentní distribuované datové soubory
- Transformace a akce v rámci zpracování dat
- Fáze, úlohy a jejich vzájemné závislosti
Praktické cvičení v prostředí Databricks – osvojení si základů:
- Cvičení s využitím rozhraní RDD API
- Základní funkce pro transformace a akce
- Použití struktury PairRDD
- Funkce spojování dat – Join
- Strategie ukládání dat do mezipaměti
- Cvičení s rozhraním DataFrame API
- Použití nástroje SparkSQL
- Ovládání DataFrame – výběr, filtrování, seskupování a řazení dat
- Vytváření vlastních funkcí – UDF (User Defined Functions)
- Přehled rozhraní DataSet API
- Zpracování dat v reálném čase – Streaming
Praktické cvičení v prostředí AWS – pochopení procesu nasazení:
- Základy služby AWS Glue
- Rozdíly mezi AWS EMR a AWS Glue
- Příklady úloh spouštěných v obou prostředích
- Výhody a nevýhody jednotlivých řešení
Doplňující informace:
- Úvod do orchestrace úloh pomocí Apache Airflow
Požadavky
Programátorské dovednosti (nejlépe v Pythonu nebo Scala)
Základy SQL
21 Hodiny
Reference (3)
Mít praktické sezení a úkoly
Poornima Chenthamarakshan - Intelligent Medical Objects
Kurz - Apache Spark in the Cloud
Přeloženo strojem
1. Správné vyvážení mezi vysokou úrovní konceptů a technickými detaily. 2. Andras je velmi dobře seznámen s tím, co učí. 3. Cvičení
Steven Wu - Intelligent Medical Objects
Kurz - Apache Spark in the Cloud
Přeloženo strojem
Při této školení se naučíte Spark Streaming, Databricks a AWS Redshift.
Lim Meng Tee - Jobstreet.com Shared Services Sdn. Bhd.
Kurz - Apache Spark in the Cloud
Přeloženo strojem