Zkuste nás kontaktovat

Návrh Školení

Úvod do machine learningu

  • Typy machine learningu – supervised vs unsupervised
  • Z statistického učení k machine learningu
  • Pracovní postup při těžbě dat: porozumění obchodnímu problému, příprava dat, modelování a nasazení
  • Výběr vhodného algoritmu podle daného úkolu
  • Přizpůsobení modelu (overfitting) a kompromis mezi odchylkou a rozptylem

Přehled Pythonu a knihoven pro machine learning

  • Proč pro účely machine learningu využít programovací jazyky
  • Srovnání R a Pythonu jako nástrojů pro machine learning
  • Úvod do programování v Pythonu a práce s Jupyter Notebooks
  • Klíčové knihovny: pandas, NumPy, scikit-learn, matplotlib, seaborn

Testování a vyhodnocování algoritmů machine learningu

  • Generalizace modelu, overfitting a validace modelů
  • Metody vyhodnocení: oddělení tréninkových a testovacích dat, křížová validace, bootstrap metoda
  • Metriky pro regresi: ME, MSE, RMSE, MAPE
  • Metriky pro klasifikaci: přesnost, matice zmatku, problém nevyvážených tříd
  • Vizualizace výkonnosti modelů: křivka zisku, ROC křivka a křivka efektivity
  • Výběr vhodného modelu a optimalizace pomocí grid search

Předzpracování dat

  • Import a ukládání dat v Pythonu
  • Eksplorativní analýza a popisné statistiky
  • Zpracování chybějících hodnot a odlehlých hodnot
  • Standardizace, normalizace a transformace dat
  • Převod kategoriálních proměnných na numerické a práce s daty pomocí pandas

Algoritmy pro klasifikaci

  • Binární versus vícenásobná klasifikace
  • Logistická regrese a diskriminační funkce
  • Naïve Bayes, algoritmus k-nearest neighbors
  • Rozhodovací stromy: CART, náhodné lesy, metody bagging, boosting, XGBoost
  • Metoda podpůrných vektorů a její různé typy kernelů
  • Ensemble techniky pro zlepšení kvality modelů

Regrese a predikce numerických hodnot

  • Metoda nejmenších čtverců a výběr proměnných
  • Regularizační metody: L1, L2
  • Polynomiální regrese a nelineární modely
  • Regresní stromy a spline aproximace

Nenadzorované učení

  • Techniky shlukování: k-means, k-medoids, hierarchické shlukování, SOM
  • Snižování počtu dimenzí: PCA, faktorová analýza, SVD
  • Multidimenzionální škálování

Těžba informací z textu

  • Předzpracování textu a tokenizace
  • Metoda bag-of-words, stemming a lemmatizace
  • Analýza sentimentů a frekvence výskytu slov
  • Vizualizace textových dat pomocí word cloudů

Systémy pro doporučování

  • Kolaborativní filtrování založené na uživatelích i položkách
  • Návrh a hodnocení systémů pro doporučování

Těžba asociovaných vzorů

  • Frekventní soubory prvků a algoritmus Apriori
  • Analýza nákupních košů a poměr efektivity doporučení

Detekce odlehlých hodnot

  • Analýza extrémních hodnot v datech
  • Metody založené na vzdálenosti a hustotě dat
  • Detekce odlehlých hodnot ve vysoce dimenzionálních datech

Případová studie z praxe

  • Porozumění danému obchodnímu problému
  • Předzpracování dat a tvorba vhodných atributů
  • Výběr modelu a optimalizace jeho parametrů
  • Vyhodnocení výsledků a jejich prezentace zákazníkovi
  • Nasazení modelu do praxe

Shrnutí a další kroky

Požadavky

  • Základní znalost statistiky a lineární algebry
  • Orientace v konceptech analýzy dat nebo obchodní inteligence
  • Doporučuje se alespoň základní zkušenosti s programováním (nejlépe v Pythonu nebo R)
  • Zájem o praktické uplatnění machine learningu při práci s daty

Cílová skupina

  • Data analytici a vědci pracující s daty
  • Statistici a výzkumní pracovníci
  • Vývojáři a IT specialisté, kteří se chtějí seznámit s nástroji pro machine learning
  • Každý, kdo se podílí na projektech v oblasti datové vědy nebo prediktivní analýzy
 21 Hodiny

Počet účastníků


Cena za účastníka

Reference (3)

Nadcházející kurzy

Související kategorie