Zkuste nás kontaktovat

Návrh Školení

Úvod do prediktivního přístupu AIOps

  • Přehled prediktivní analýzy v kontextu správy IT
  • Zdroje dat pro předpovídání (logy, metriky, události)
  • Klíčové koncepty v předpovídání časových řad a rozpoznávání anomálií

Návrh modelů pro predikci incidentů

  • Označování historických incidentů a chování systémů
  • Výběr a trénování modelů (např. LSTM, Random Forest, AutoML)
  • Hodnocení výkonnosti modelů a způsoby řešení falešně pozitivních výsledků

Sběr dat a vytváření relevantních charakteristik

  • Získávání a sjednocování logů i metrik určených k vstupu do modelů
  • Extrakce užitečných informací ze strukturovaných i nestrukturovaných dat
  • Zvládání šumu a chybějících údajů v provozních procesech

Automatizace určování příčin incidentů (RCA)

  • Vytváření grafů vztahů mezi službami a infrastrukturou
  • Využití strojového učení k odhadu pravděpodobných příčin na základě sledu událostí
  • Zobrazování výsledků určování příčin pomocí interaktivních dashboardů s vizualizací topologie systému

Automatizace nápravných kroků a pracovních postupů

  • Integrace s platformami pro automatizaci (např. Ansible, Rundeck)
  • Spouštění akcí typu obnovení stavu systému, restart nebo přesměrování provozu
  • Zaznamenávání a dokumentování všech automaticky provedených zásahů

Škálování inteligentních systémů AIOps

  • MLOps pro monitorovací nástroje: opětovné trénování a správa verzí modelů
  • Provádění predikcí v reálném čase napříč více systémy a uzly
  • Osvědčené postupy při nasazování AIOps do produkčního prostředí

Případové studie a praktická využití

  • Analýza skutečných dat o incidentech pomocí prediktivních modelů AIOps
  • Nasazení systémů pro určování příčin v prostředích využívajících umělou data i data z produkce
  • Přehled reálných příkladů využití: výpadky cloudových služeb, nestabilita mikroslužeb či degradace síťového provozu

Závěr a další kroky

Požadavky

  • Zkušenosti s monitorovacími systémy jako je Prometheus nebo ELK
  • Praktická znalost jazyka Python a základů strojového učení
  • Seznámenost s pracovními postupy řízení incidentů

Cílové skupiny

  • Zkušení inženýři pro spolehlivost systémů (SRE)
  • Architekti automatizace IT
  • Vedoucí specialisté v oblasti DevOps a platform pro monitorování
 14 Hodiny

Počet účastníků


Cena za účastníka

Nadcházející kurzy

Související kategorie