Zkuste nás kontaktovat

Návrh Školení

Podrobný přehled výuky

  1. Úvod do NLP
    • Pochopení NLP
    • Rámce (frameworky) NLP
    • Komerční aplikace NLP
    • Skrápování dat z webu
    • Práce s různými API pro získávání textových dat
    • Práce s textovými korpuse, ukládání obsahu a příslušných metadat
    • Výhody používání Pythonu a krátký kurz NLTK
  2. Praktické pochopení korpuse a datové sady
    • Proč potřebujeme korpus?
    • Analýza korpuse
    • Typy datových atributů
    • Různé formáty souborů pro korpusy
    • Příprava datové sady pro aplikace NLP
  3. Pochopení struktury věty
    • Komponenty NLP
    • Rozumění přirozenému jazyku
    • Morfologická analýza - kořen slova, slovo, token, jazykové štítky
    • Syntaktická analýza
    • Semantická analýza
    • Řešení nejednoznačnosti
  4. Předzpracování textových dat
    • Korpus - surový text
      • Tokenizace vět
      • Lemnace pro surový text
      • Lemnizace surového textu
      • Odstranění stop slov
    • Korpus - surové věty
      • Tokenizace slov
      • Lemnizace slov
    • Práce s maticemi Slovo-Dokument / Dokument-Slovo
    • Tokenizace textu do n-gramů a vět
    • Praktické a přizpůsobené předzpracování
  5. Analýza textových dat
    • Základní vlastnosti NLP
      • Parsoři a parsování
      • Prirazování jazykových štítků (POS) a tagery
      • Rozpoznávání jmenovaných entit
      • N-gramy
      • Bag of words (Vaky slov)
    • Statistické vlastnosti NLP
      • Koncepty lineární algebry pro NLP
      • Teorie pravděpodobnosti pro NLP
      • TF-IDF
      • Vektorizace
      • Kódek a dekódek
      • Normalizace
      • Stochastické modely
    • Pokročilé inženýrství vlastností a NLP
      • Základy word2vec
      • Komponenty modelu word2vec
      • Logika modelu word2vec
      • Rozšíření konceptu word2vec
      • Aplikace modelu word2vec
    • Studium případu: Aplikace bag of words: automatické shrnování textu pomocí zjednodušeného a skutečného Luhnova algoritmu
  6. Klastrování dokumentů, klasifikace a modelování témat
    • Klastrování dokumentů a průzkum vzorů (hierarchické klastrování, k-means, atd.)
    • Srovnávání a klasifikace dokumentů pomocí opatření vzdálenosti TFIDF, Jaccard a kosinusové
    • Klasifikace dokumentů pomocí Naive Bayes a Maximum Entropy
  7. Identifikace důležitých prvků textu
    • Redukce dimenzí: Analýza hlavních komponent, Rozklad na singulární hodnoty, Nezáporná maticová faktorizace
    • Modelování témat a vyhledávání informací pomocí Latent Semantic Analysis
  8. Extrakce entit, analýza sentimentu a pokročilé modelování témat
    • Pozitivní vs. negativní: stupeň sentimentu
    • Teorie odpovědí (Item Response Theory)
    • Prirazování jazykových štítků (POS) a jeho aplikace: nacházení lidí, míst a organizací zmíněných v textu
    • Pokročilé modelování témat: Latent Dirichlet Allocation
  9. Studium případů
    • Průzkum nestrukturovaných uživatelských recenzí
    • Klasifikace a vizualizace sentimentu produktových recenzí
    • Průzkum protokolů vyhledávání pro vzorce používání
    • Klasifikace textu
    • Modelování témat

Požadavky

Znalost a povědomí o principech NLP a pochopení využití AI v obchodním prostředí

 21 Hodiny

Počet účastníků


Cena za účastníka

Reference (1)

Nadcházející kurzy

Související kategorie