Návrh Školení
Úvod
Přehled velkých dat
Co je Spark?
Co je Python?
Co je PySpark?
- Rozdělování dat pomocí frameworku Resilient Distributed Datasets
- Rozdělování výpočtů pomocí operátorů API Sparku
Nastavení Pythonu pro práci se Sparkem
Konfigurace prostředí PySpark
Použití instancí AWS EC2 ke spuštění Sparku
Nastavení platformy Databricks
Vytvoření clusteru AWS EMR
Základy programování v Pythonu
- Začátky s Pythonem
- Použití nástroje Jupyter Notebook
- Pracovní proměnné a jednoduché datové typy
- Pracovní s seznamy
- Využití podmínkových příkazů if
- Zpracování uživatelského vstupu
- Použití cyklů while
- Definice funkcí
- Pracovní s třídami
- Práce se soubory a ošetřování chyb
- Pracovní s projekty, daty a API
Základy práce s DataFrame v Sparku
- Seznámení se strukturou Spark DataFrames
- Provádění základních operací ve Sparku
- Agregace a seskupování dat
- Pracovní s časovými údaji a daty
Cvičení na práci s projektem využívajícím Spark DataFrame
Seznámení se strojovým učením pomocí knihovny MLlib
Využití MLlib, Sparku a Pythonu pro strojové učení
Přehled regresních metod
- Teorie lineární regrese
- Napsání kódu na vyhodnocení regrese
- Cvičení využívající lineární regresi
- Teorie logistické regrese
- Napsání kódu pro logistickou regresi
- Cvičení využívající logistickou regresi
Přehled náhodných lesů a rozhodovacích stromů
- Teorie rozhodovacích stromů a náhodných lesů
- Napsání kódu pro implementaci těchto metod
- Cvičení na klasifikaci pomocí náhodných lesů
Implementace algoritmu K-means clusteringu
- Teorie K-means clusteringu
- Napsání kódu pro K-means clustering
- Cvičení na využití tohoto algoritmu
Příklady doporučovacích systémů
Základy zpracování přirozeného jazyka
- Co je přirozený jazyk a jak ho analyzovat?
- Přehled nástrojů pro NLP
- Cvičení využívající techniky NLP
Práce se streamováním dat pomocí Sparku a Pythonu
- Základy streamování s využitím Sparku
- Cvičení na implementaci datového streamu
Závěrečné poznámky
Požadavky
- Základní znalosti programování
Cílové skupiny
- Vývojáři
- IT odborníci
- Data scientista
Reference (6)
Líbilo se mi, že to bylo praktické. Miloval jsem aplikovat teoretické znalosti na praktické příklady.
Aurelia-Adriana - Allianz Services Romania
Kurz - Python and Spark for Big Data (PySpark)
Přeloženo strojem
Kurz se týkal řady velmi komplexních souvisejících témat a Pablo má hlubokou odbornost v každém z nich. Občas byly odstíny při komunikaci ztraceny a/nebo kvůli časovým tlačením, což možná vedlo k tomu, že nebyly splněny očekávání. Kromě toho došlo k některým problémům s nastavením UHG/Azure Databricks, ale Pablo a UHG je rychle vyřešili, jakmile se projevily - to mi ukázalo vysokou úroveň pochopení a profesionality mezi UHG a Pablo.
Michael Monks - Tech NorthWest Skillnet
Kurz - Python and Spark for Big Data (PySpark)
Přeloženo strojem
Jednotlivá pozornost.
ARCHANA ANILKUMAR - PPL
Kurz - Python and Spark for Big Data (PySpark)
Přeloženo strojem
Přímo v praxi se naučíte..
Abraham Thomas - PPL
Kurz - Python and Spark for Big Data (PySpark)
Přeloženo strojem
Lekce byly vyučovány v Jupyter notebooku. Téma byla strukturována s logickou sekvencí a přirozeně pomáhala rozvíjet sezení od jednoduchších částí k složitějším. Už jsem pokročilý uživatel Pythonu s pozadím v oblasti strojového učení, takže mi kurz připadal snazší k sledování než možná některým z mých spolužáků, kteří absolvovali školení. Oceňuji, že byly vynechány některé ze základních pojmů a že se soustředil na nejdůležitější otázky.
Angela DeLaMora - ADT, LLC
Kurz - Python and Spark for Big Data (PySpark)
Přeloženo strojem
cvičné úkoly
Pawel Kozikowski - GE Medical Systems Polska Sp. Zoo
Kurz - Python and Spark for Big Data (PySpark)
Přeloženo strojem