Návrh Školení
Úvod do machine learningu
- Typy machine learningu – supervised vs unsupervised
- Z statistického učení k machine learningu
- Pracovní postup při těžbě dat: porozumění obchodnímu problému, příprava dat, modelování a nasazení
- Výběr vhodného algoritmu podle daného úkolu
- Přizpůsobení modelu (overfitting) a kompromis mezi odchylkou a rozptylem
Přehled Pythonu a knihoven pro machine learning
- Proč pro účely machine learningu využít programovací jazyky
- Srovnání R a Pythonu jako nástrojů pro machine learning
- Úvod do programování v Pythonu a práce s Jupyter Notebooks
- Klíčové knihovny: pandas, NumPy, scikit-learn, matplotlib, seaborn
Testování a vyhodnocování algoritmů machine learningu
- Generalizace modelu, overfitting a validace modelů
- Metody vyhodnocení: oddělení tréninkových a testovacích dat, křížová validace, bootstrap metoda
- Metriky pro regresi: ME, MSE, RMSE, MAPE
- Metriky pro klasifikaci: přesnost, matice zmatku, problém nevyvážených tříd
- Vizualizace výkonnosti modelů: křivka zisku, ROC křivka a křivka efektivity
- Výběr vhodného modelu a optimalizace pomocí grid search
Předzpracování dat
- Import a ukládání dat v Pythonu
- Eksplorativní analýza a popisné statistiky
- Zpracování chybějících hodnot a odlehlých hodnot
- Standardizace, normalizace a transformace dat
- Převod kategoriálních proměnných na numerické a práce s daty pomocí pandas
Algoritmy pro klasifikaci
- Binární versus vícenásobná klasifikace
- Logistická regrese a diskriminační funkce
- Naïve Bayes, algoritmus k-nearest neighbors
- Rozhodovací stromy: CART, náhodné lesy, metody bagging, boosting, XGBoost
- Metoda podpůrných vektorů a její různé typy kernelů
- Ensemble techniky pro zlepšení kvality modelů
Regrese a predikce numerických hodnot
- Metoda nejmenších čtverců a výběr proměnných
- Regularizační metody: L1, L2
- Polynomiální regrese a nelineární modely
- Regresní stromy a spline aproximace
Nenadzorované učení
- Techniky shlukování: k-means, k-medoids, hierarchické shlukování, SOM
- Snižování počtu dimenzí: PCA, faktorová analýza, SVD
- Multidimenzionální škálování
Těžba informací z textu
- Předzpracování textu a tokenizace
- Metoda bag-of-words, stemming a lemmatizace
- Analýza sentimentů a frekvence výskytu slov
- Vizualizace textových dat pomocí word cloudů
Systémy pro doporučování
- Kolaborativní filtrování založené na uživatelích i položkách
- Návrh a hodnocení systémů pro doporučování
Těžba asociovaných vzorů
- Frekventní soubory prvků a algoritmus Apriori
- Analýza nákupních košů a poměr efektivity doporučení
Detekce odlehlých hodnot
- Analýza extrémních hodnot v datech
- Metody založené na vzdálenosti a hustotě dat
- Detekce odlehlých hodnot ve vysoce dimenzionálních datech
Případová studie z praxe
- Porozumění danému obchodnímu problému
- Předzpracování dat a tvorba vhodných atributů
- Výběr modelu a optimalizace jeho parametrů
- Vyhodnocení výsledků a jejich prezentace zákazníkovi
- Nasazení modelu do praxe
Shrnutí a další kroky
Požadavky
- Základní znalost statistiky a lineární algebry
- Orientace v konceptech analýzy dat nebo obchodní inteligence
- Doporučuje se alespoň základní zkušenosti s programováním (nejlépe v Pythonu nebo R)
- Zájem o praktické uplatnění machine learningu při práci s daty
Cílová skupina
- Data analytici a vědci pracující s daty
- Statistici a výzkumní pracovníci
- Vývojáři a IT specialisté, kteří se chtějí seznámit s nástroji pro machine learning
- Každý, kdo se podílí na projektech v oblasti datové vědy nebo prediktivní analýzy
Reference (3)
I i když jsem musel vynechat jeden den kvůli zákaznickým jednáním, cítím, že mám mnohem jasnější představu o procesech a technikách používaných v strojovém učení a kdy bych jednotlivé přístupy uplatňoval. Náš úkol nyní je procvičit si to, co jsme se naučili, a začít to aplikovat na naše oblasti problémů.
Richard Blewett - Rock Solid Knowledge Ltd
Kurz - Machine Learning – Data science
Přeloženo strojem
Mělo mi za líbezné, že školení bylo zaměřené na příklady a programování. Předpokládal jsem, že je nemožné zabalit tolik obsahu do třídního školení, ale mýlil jsem se. Školení pokrývalo mnoho témat a všechno bylo provedeno velmi podrobně (zejména ladění parametrů modelu - nečekal jsem, že na to bude čas, a byl jsem velmi příjemně překvapen).
Bartosz Rosiek - GE Medical Systems Polska Sp. Zoo
Kurz - Machine Learning – Data science
Přeloženo strojem
Ukazuje mnoho metod s předem připravenými skripty - velmi dobře připravené materiály a snadné zpětné sledování.
Kamila Begej - GE Medical Systems Polska Sp. Zoo
Kurz - Machine Learning – Data science
Přeloženo strojem