Zkuste nás kontaktovat

Návrh Školení

Úvod

Tato sekce poskytuje obecné úvodní informace o tom, kdy využívat 'strojové učení', na co je třeba si dát pozor a co to vše znamená, včetně výhod a nevýhod. Typy dat (strukturovaná/nestrukturovaná/statická/proudová), validita a objem dat, analýzy řízené daty vs. uživatelsky řízené analýzy, statistické modely vs. modely strojového učení, výzvy nenasazeného učení, kompromis mezi chybou a rozptylem, iterace/hodnocení, přístupy křížové validace, nadzorované/nenasazené/učení s posilou.

Hlavní témata

1. Pochopení Naive Bayes

  • Základní koncepty bayesovských metod
  • Pravděpodobnost
  • Spojená pravděpodobnost
  • Podmíněná pravděpodobnost s Bayesovou větou
  • Algoritmus Naive Bayes
  • Klasifikace pomocí Naive Bayes
  • Laplaciovský odhadovač
  • Použití číselných znaků s Naive Bayes

2. Pochopení rozhodovacích stromů

  • Rozděl a nadvlaďuj
  • Algoritmus rozhodovacího stromu C5.0
  • Výběr nejlepšího rozdělení
  • Stříhání rozhodovacího stromu

3. Pochopení neuronových sítí

  • Od biologických k umělým neuronům
  • Aktivační funkce
  • Topologie sítě
  • Počet vrstev
  • Směr pohybu informací
  • Počet uzlů v každé vrstvě
  • Trénování neuronových sítí zpětným rozptylem (backpropagation)
  • Hluboké učení

4. Pochopení podporních vektorových strojů (SVM)

  • Klasifikace pomocí hyperrovin
  • Najdenní maximální mezeru
  • Případ lineárně oddělitelných dat
  • Případ nelineárně oddělitelných dat
  • Použití jader (kernels) pro nelineární prostory

5. Pochopení shlukování (clustering)

  • Shlukování jako úloha strojového učení
  • Algoritmus k-means pro shlukování
  • Použití vzdálenosti pro přiřazování a aktualizaci shluků
  • Výběr vhodného počtu shluků

6. Měření výkonu klasifikace

  • Práce s daty predikce klasifikace
  • Důkladnější pohled na matice zmatení (confusion matrices)
  • Použití matic zmatení pro měření výkonu
  • Mimo přesnost – další metriky výkonu
  • Statistika kappa
  • Senzitivita a specificita
  • Přesnost (precision) a recall
  • Opatření F (F-measure)
  • Vizualizace kompromisů výkonu
  • ROC křivky
  • Odhad budoucího výkonu
  • Metoda holdout
  • Křížová validace
  • Bootstrap vzorkování

7. Ladění standardních modelů pro lepší výkon

  • Použití knihovny caret pro automatické ladění parametrů
  • Vytvoření jednoduchého ladeného modelu
  • Přizpůsobení procesu ladění
  • Zlepšování výkonu modelu pomocí metaučení
  • Pochopení souborů (ensembles)
  • Bagging
  • Boosting
  • Náhodné lesy (Random forests)
  • Trénování náhodných lesů
  • Hodnocení výkonu náhodných lesů

Další témata

8. Pochopení klasifikace pomocí nejbližších sousedů

  • Algoritmus kNN
  • Výpočet vzdálenosti
  • Výběr vhodného k
  • Příprava dat pro použití s kNN
  • Proč je algoritmus kNN lenivý?

9. Pochopení klasifikačních pravidel

  • Rozděl a nadvlaďuj (Separate and conquer)
  • Algoritmus One Rule
  • Algoritmus RIPPER
  • Pravidla z rozhodovacích stromů

10. Pochopení regrese

  • Jednoduchá lineární regrese
  • Odhad metodou nejmenších čtverců
  • Korelace
  • Víceproměnná lineární regrese

11. Pochopení regulačních stromů a modelových stromů

  • Přidání regrese do stromů

12. Pochopení asociativních pravidel

  • Algoritmus Apriori pro učení asociativních pravidel
  • Měření zajímavosti pravidel – podpora a důvěra
  • Buildování sady pravidel pomocí Aprioriho principu

Přílohy

  • Spark/PySpark/MLlib a Multi-armed bandits

Požadavky

Znalost jazyka Python

 21 Hodiny

Počet účastníků


Cena za účastníka

Reference (7)

Nadcházející kurzy

Související kategorie