Děkujeme za vaši dotaz! Jeden z našich pracovníků vás brzy kontaktuje.
Děkujeme za rezervaci! Jeden z našich pracovníků vás brzy kontaktuje.
Návrh Školení
Úvod do prediktivního přístupu AIOps
- Přehled prediktivní analýzy v kontextu správy IT
- Zdroje dat pro předpovídání (logy, metriky, události)
- Klíčové koncepty v předpovídání časových řad a rozpoznávání anomálií
Návrh modelů pro predikci incidentů
- Označování historických incidentů a chování systémů
- Výběr a trénování modelů (např. LSTM, Random Forest, AutoML)
- Hodnocení výkonnosti modelů a způsoby řešení falešně pozitivních výsledků
Sběr dat a vytváření relevantních charakteristik
- Získávání a sjednocování logů i metrik určených k vstupu do modelů
- Extrakce užitečných informací ze strukturovaných i nestrukturovaných dat
- Zvládání šumu a chybějících údajů v provozních procesech
Automatizace určování příčin incidentů (RCA)
- Vytváření grafů vztahů mezi službami a infrastrukturou
- Využití strojového učení k odhadu pravděpodobných příčin na základě sledu událostí
- Zobrazování výsledků určování příčin pomocí interaktivních dashboardů s vizualizací topologie systému
Automatizace nápravných kroků a pracovních postupů
- Integrace s platformami pro automatizaci (např. Ansible, Rundeck)
- Spouštění akcí typu obnovení stavu systému, restart nebo přesměrování provozu
- Zaznamenávání a dokumentování všech automaticky provedených zásahů
Škálování inteligentních systémů AIOps
- MLOps pro monitorovací nástroje: opětovné trénování a správa verzí modelů
- Provádění predikcí v reálném čase napříč více systémy a uzly
- Osvědčené postupy při nasazování AIOps do produkčního prostředí
Případové studie a praktická využití
- Analýza skutečných dat o incidentech pomocí prediktivních modelů AIOps
- Nasazení systémů pro určování příčin v prostředích využívajících umělou data i data z produkce
- Přehled reálných příkladů využití: výpadky cloudových služeb, nestabilita mikroslužeb či degradace síťového provozu
Závěr a další kroky
Požadavky
- Zkušenosti s monitorovacími systémy jako je Prometheus nebo ELK
- Praktická znalost jazyka Python a základů strojového učení
- Seznámenost s pracovními postupy řízení incidentů
Cílové skupiny
- Zkušení inženýři pro spolehlivost systémů (SRE)
- Architekti automatizace IT
- Vedoucí specialisté v oblasti DevOps a platform pro monitorování
14 Hodiny