Zkuste nás kontaktovat

Návrh Školení

Úvod

Přehled velkých dat

Co je Spark?

Co je Python?

Co je PySpark?

  • Rozdělování dat pomocí frameworku Resilient Distributed Datasets
  • Rozdělování výpočtů pomocí operátorů API Sparku

Nastavení Pythonu pro práci se Sparkem

Konfigurace prostředí PySpark

Použití instancí AWS EC2 ke spuštění Sparku

Nastavení platformy Databricks

Vytvoření clusteru AWS EMR

Základy programování v Pythonu

  • Začátky s Pythonem
  • Použití nástroje Jupyter Notebook
  • Pracovní proměnné a jednoduché datové typy
  • Pracovní s seznamy
  • Využití podmínkových příkazů if
  • Zpracování uživatelského vstupu
  • Použití cyklů while
  • Definice funkcí
  • Pracovní s třídami
  • Práce se soubory a ošetřování chyb
  • Pracovní s projekty, daty a API

Základy práce s DataFrame v Sparku

  • Seznámení se strukturou Spark DataFrames
  • Provádění základních operací ve Sparku
  • Agregace a seskupování dat
  • Pracovní s časovými údaji a daty

Cvičení na práci s projektem využívajícím Spark DataFrame

Seznámení se strojovým učením pomocí knihovny MLlib

Využití MLlib, Sparku a Pythonu pro strojové učení

Přehled regresních metod

  • Teorie lineární regrese
  • Napsání kódu na vyhodnocení regrese
  • Cvičení využívající lineární regresi
  • Teorie logistické regrese
  • Napsání kódu pro logistickou regresi
  • Cvičení využívající logistickou regresi

Přehled náhodných lesů a rozhodovacích stromů

  • Teorie rozhodovacích stromů a náhodných lesů
  • Napsání kódu pro implementaci těchto metod
  • Cvičení na klasifikaci pomocí náhodných lesů

Implementace algoritmu K-means clusteringu

  • Teorie K-means clusteringu
  • Napsání kódu pro K-means clustering
  • Cvičení na využití tohoto algoritmu

Příklady doporučovacích systémů

Základy zpracování přirozeného jazyka

  • Co je přirozený jazyk a jak ho analyzovat?
  • Přehled nástrojů pro NLP
  • Cvičení využívající techniky NLP

Práce se streamováním dat pomocí Sparku a Pythonu

  • Základy streamování s využitím Sparku
  • Cvičení na implementaci datového streamu

Závěrečné poznámky

Požadavky

  • Základní znalosti programování

Cílové skupiny

  • Vývojáři
  • IT odborníci
  • Data scientista
 21 Hodiny

Počet účastníků


Cena za účastníka

Reference (6)

Nadcházející kurzy

Související kategorie