Datové streamy a zpracování dat v reálném čase Počítačový Kurz
Přehled kurzu
Tento kurz nabízí praktický a strukturovaný úvod do tvorby systémů na streamování dat v reálném čase. Seznámí vás s klíčovými koncepty, architektonickými vzory a nástroji používanými v praxi k zpracovávání nepřetržitě proudících dat. Účastníci se naučí navrhovat, implementovat a optimalizovat streamovací kanály s využitím moderních frameworků. Kurz postupně vede od základních principů až po konkrétní praktické aplikace, aby si každý účastník mohl samostatně vybudovat funkčná řešení pro reálné podnikatelské využití.
Forma školení
• Lekce vedené instruktorem s podrobným výkladem
• Vysvětlování konceptů na reálných příkladech z praxe
• Praktická ukázky a programátorské cvičení
• Postupné laboratoře odpovídající jednotlivým tématům dne
• Interaktivní diskuse a možnost klást otázky
Cíle kurzu
• Porozumět konceptům streamování dat v reálném čase i celkové architektuře systémů
• Rozlišovat mezi modely zpracování dávkových a streamovaných dat
¢ Navrhnout škálovatelné a odolné proti chybám streamovací kanály
• Pracovat s distribuovanými nástroji na streamování a příslušnými frameworky
• Využívat zpracování na základě časových údajů událostí, techniky okénkování a operace s uloženým stavem dat
Tvorba a optimalizace řešení pro zpracování dat v reálném čase v souladu s potřebami podniků.
Návrh Školení
Obsah kurzu – Den 1
• Úvod do konceptů datového streamingu
• Základy zpracování dávkových a reálně časových dat
• Základní principy architektury orientované na události
• Běžné případové využití v průmyslu
• Přehled ekosystému streamování dat
Den 2
• Návrh architektury pro streamování dat – osvědčené vzory
¢ Základy distribuovaných systémů na přenos zpráv
• Producenti a konzumenti dat
• Témata, rozdělení dat a jejich tok v systému
• Strategie na získávání dat do systému
Den 3
• Koncepty a frameworky pro streamovací zpracování
• Rozdíl mezi časem události a dobou zpracování dat
• Techniky okénkování a jejich využití v praxi
• Zpracování streamů s využitím uloženého stavu
• Význam odolnosti systému proti chybám a principy kontrolních bodů
Den 4
• Transformace dat v rámci streamovacích kanálů
• Metody ETL a ELT pro systémy v reálném čase
• Správa schémat dat a jejich rozvoj
• Spojování a obohacování dat ze streamů
¢ Seznámení s cloudovými nástroji na zpracovávání dat v reálném čase
Den 5
• Sledování a monitorování streamovacích systémů
• Základní aspekty zabezpečení a kontroly přístupu k datům
• Optimalizace výkonu systémů
• Celkové zhodnocení navrženého řešení – recenze celého kanálu od začátku do konce
• Příklady reálných aplikací, jako je detekce podvodů nebo zpracování dat z IoT.
Veřejné školení vyžaduje minimálně 5 účastníků.
Datové streamy a zpracování dat v reálném čase Počítačový Kurz - Rezervace
Datové streamy a zpracování dat v reálném čase Počítačový Kurz - Dotaz
Datové streamy a zpracování dat v reálném čase - Dotaz ohledně konzultace
Reference (2)
Cesta světem Sparku: velmi intenzivní kurz. DSL, Spark SQL, rozdělování oproti kbelíkování pro mě.
Georgiana Elisabeta
Kurz - Apache Spark Fundamentals
Přeloženo strojem
Praktické cvičení. Třída by měla trvat 5 dní, ale i tři dny pomohly rozjasnit spoustu otázek, které jsem měl z práce s NiFi.
James - BHG Financial
Kurz - Apache NiFi for Administrators
Přeloženo strojem
Nadcházející kurzy
Související kurzy
Pokročilý Apache Iceberg
21 HodinyToto školení pod vedením lektora České republice (online nebo na místě) je určeno pro pokročilé pracovníky v oblasti dat, kteří chtějí optimalizovat pracovní postupy při zpracování dat, zajistit jejich integritu a vytvořit robustní řešení typu data lakehouse schopná reagovat na složitosti moderních velkých datových aplikací.
Po absolvování tohoto kurzu budou účastníci schopni:
- Hluboce porozumět architektuře Icebergu, včetně správy metadat a uspořádání souborů.
- Konfigurovat Iceberg tak, aby dosahoval optimálního výkonu v různých prostředích a integrovat ho s několika nástroji na zpracování dat.
- Spravovat rozsáhlé tabulky Iceberg, provádět komplexní změny schématu a řešit evoluci partitions.
- Ovládat techniky pro optimalizaci výkonu dotazů a efektivitu skenování velkých datových sad.
- Zavádět mechanismy zajišťující konzistenci dat, transakční spolehlivost a odolnost vůči chybám v distribuovaných prostředích.
Základy Apache Iceberg
14 HodinyTento kurz vedený instruktorem České republice (online nebo prezenčně) je určen pro začínající pracovníky v oblasti dat, kteří si chtějí osvojit znalosti a dovednosti potřebné k efektivnímu využívání Apache Iceberg při správě rozsáhlých datových sad, zajištění integrity dat a optimalizaci procesů jejich zpracování.
Po absolvování tohoto kurzu budou účastníci schopni:
- Podrobně porozumět architektuře, vlastnostem a výhodám Apache Iceberg.
- Seznámit se s formáty tabulek, dělením dat podle partitioningu, vývojem schémat a možnostmi návratu v čase (time travel).
- Nainstalovat a konfigurovat Apache Iceberg v různých prostředích.
- Vytvářet, spravovat a upravovat tabulky typu Iceberg.
- Pochopit postup migrace dat z jiných formátů tabulek do Apache Iceberg.
Analýza velkých dat pomocí Google Colab a Apache Spark
14 HodinyToto živé školení vedené lektorem <na místě> (online nebo na místě) je určeno pro datové vědce a inženýry středně pokročilé úrovně, kteří chtějí využít Google Colab a Apache Spark ke zpracování velkých dat.
Po absolvování tohoto kurzu budou účastníci schopni:
- Nastavit prostředí pro práci s velkými daty pomocí Google Colab a Sparku.
- Efektivně zpracovávat a analyzovat rozsáhlé datové sady pomocí Apache Sparku.
- Vizualizovat velká data v prostředí umožňujícím spolupráci více uživatelů.
- Integrovat Apache Spark s nástroji cloudových platforem.
Businessová inteligence s využitím velkých dat pro vládní agentury
35 HodinyPokroky v technologiích a rostoucí objem informací mění způsob podnikání v mnoha odvětvích, včetně sektoru veřejné správy. Díky rychlému rozvoji mobilních zařízení a aplikací, chytrých senzorů, cloudových řešení a portálů určených k interakci s občany stoupá tvorba a digitální archivace vládních dat. Jak se množství digitálních informací zvyšuje a jejich struktura se komplikuje, roste i náročnost na jejich správu, zpracování, ukládání, zabezpečení a vyřazování. Nové nástroje pro sběr dat, vyhledávání, objevování a analýzu pomáhají organizacím získat cenné poznatky i ze strukturovaných i nestrukturovaných dat. Vládní sektor nyní stojí na rozcestí – uvědomuje si, že informace jsou strategickým aktivem a je nezbytné je chránit, využívat a analyzovat tak, aby lépe plnily úkoly i potřeby občanů. Vládní lídři usilují o přeměnu svých organizací na datově orientované subjekty, čímž vytváří základy pro propojování vzájemných vztahů mezi událostmi, lidmi, procesy a informacemi.
Vysoce hodnotná řešení pro vládní sféru budou vznikat na základě kombinace nejprůlomovějších technologií:
- Mobilní zařízení a aplikace
- Cloudové služby
- Sociální obchodní technologie a síťová komunikace
- Velká data a jejich analýza
Velká data představují jedno z klíčových průmyslových řešení, které umožňuje vládám činit lepší rozhodnutí na základě rozpoznání vzorců ve velkém množství dat – ať už strukturovaných nebo nestrukturovaných.
Realizace takových cílů však vyžaduje víc než jen shromažďování obrovského množství dat. „Aby bylo možné tyto objemné svazy velkých dat skutečně pochopit, potřebujeme špičkové nástroje a technologie schopné z nich extrahovat užitečné informace,“ uvádí Tom Kalil a Fen Zhao z Úřadu pro vědu a technologickou politiku Bílého domu ve svém příspěvku na blogu OSTP.
V roce 2012 podpořil Bílý dům vládní agentury v jejich snaze o zavedení těchto technologií zřízením Národní iniciativy pro výzkum a rozvoj velkých dat. Tato iniciativa vyčlenila více než 200 milionů dolarů na využití potenciálu velkých dat i nástrojů určených k jejich analýze.
Výzvy spojené s velkými daty jsou téměř stejně velké jako jejich přínos. Mezi ně patří efektivní ukládání dat. Rozpočty vládních institucí zůstávají vždy omezené, a proto je nutné minimalizovat náklady na uložení dat za megabajt a zároveň zajišťovat snadný přístup k nim v momentě potřeby. Další komplikací je pak zálohování obrovských objemů informací.
Stejně důležitou výzvou je i efektivní analýza dat. Mnohé agentury využívají komerční nástroje, jež jim pomáhají procházet ohromnými množstvími informací a identifikovat trendy vedoucí ke zvýšení efektivity činnosti. Podle nedávné studie společnosti MeriTalk si ředitelé IT ve vládním sektoru uvědomují, že velká data mohou agenturám pomoci ušetřit více než 500 miliard dolarů a současně lépe plnit jejich úkoly.
Vládní instituce rovněž využívají vlastní nástroje pro práci s velkými daty. Například skupina Computational Data Analytics z Oak Ridge National Laboratory uvolnila svůj analytický systém Piranha i dalším agenturám. Ten pomohl lékařským výzkumníkům objevit spojitost, díky které lze včas rozpoznat aneuryzmata aorty. Využívá se také k méně „dramatickým“ úkolům – například při vyhledávání vysoko kvalifikovaných uchazečů na pracovní pozice na základě jejich životopisů.
Praktický úvod do analýzy dat a velkých dat – 3 dny
21 HodinyÚčastníci, kteří absolvují tento praktický kurz pod vedením lektora v České republice, získají reálné znalosti o velkých datech a souvisejících technologiích, metodách a nástrojích.
Během kurzu budou mít účastníci možnost tyto poznatky uplatnit v praxi prostřednictvím názorných cvičení. Důležitou součástí výuky je také spolupráce ve skupinách a zpětná vazba od lektora.
Kurz začíná úvodem do základních konceptů velkých dat, poté se zaměří na programovací jazyky a metody určené k analýze dat. Na závěr rozebíráme nástroje a infrastrukturu umožňující ukládání velkých dat, jejich distribuované zpracování a škálovatelnost.
Velká data a pokročilá analytika
42 HodinyVelká data a pokročilá analytika zahrnují využití sofistikovaných technik a nástrojů k analýze rozsáhlých a složitých datových souborů za účelem získání prakticky použitelných poznatků a podpory strategického rozhodování.
Toto školení vedené instruktorem (online nebo na místě) je určeno pro pokročilé datové profesionály, kteří chtějí využít nejnovější analytické metody a technologie z oblasti velkých dat k prediktivní, preskriptivní i reálně časové analýze.
Po absolvování tohoto kurzu budou účastníci schopni:
- Navrhnout a realizovat rozsáhlé datové procesní pipeline pro strukturovaná i nestrukturovaná data.
- Aplikovat pokročilé metody strojového učení a hlubokého učení na velmi rozsáhlé datové soubory.
- Využívat distribuované výpočetní rámce k reálně časové analýze a zpracování datových toků.
- Integrovat analytiku velkých dat do systémů pro obchodní inteligenci a rozhodování.
Forma kurzu
- Interaktivní přednášky s diskuzemi.
- Velké množství cvičení a praktických úkolů.
- Praktická realizace v prostředí testovací laboratoře.
Možnosti přizpůsobení kurzu
- Pokud si přejete požádat o individuálně upravený kurz, kontaktujte nás za účelem domluvy.
Apache NiFi pro správce systémů
21 HodinyApache NiFi je open-source platforma určená k integraci dat a zpracování událostí na principu toků. Umožňuje automatizované a v reálném čase provádění směrování, transformace dat a mediaci mezi různými systémy s využitím webového uživatelského rozhraní a detailní kontroly.
Toto školení pod vedením lektora (na místě nebo vzdáleně) je určeno správcům systémů a inženýrům středně pokročilé úrovně, kteří chtějí nasazovat, spravovat, zabezpečovat a optimalizovat datové toky v prostředí produkce.
Po absolvování tohoto kurzu budou účastníci schopni:
- Instalovat, konfigurovat a udržovat clustery Apache NiFi.
- Navrhovat a spravovat datové toky z různých zdrojů i cílů.
- Implementovat automatizaci toků, jejich směrování a transformační logiku.
- Optimalizovat výkon systému, monitorovat jeho chod a řešit případné problémy.
Formát kurzu
- Interaktivní výklad s diskuzí o skutečných architekturách systémů.
- Praktické cvičení: vytváření, nasazování a správa datových toků.
- Cvičení založená na konkrétních scénářích v prostředí laboratoří.
Možnosti přizpůsobení kurzu
- Chcete-li si vyžádat individuálně upravené školení, kontaktujte nás pro domluvu.
PySpark a strojové učení
21 HodinyToto školení poskytuje praktický úvod do tvorby škálovatelných datových procesů a pracovních postupů v oblasti strojového učení s využitím nástroje PySpark. Účastníci se seznámí s tím, jak Apache Spark funguje v rámci moderních ekosystémů pro velká data a jak efektivně zpracovávat rozsáhlé datové soubory na základě principů distribuovaného výpočtu.
Základy Apache Sparku
21 HodinyToto školení vedené lektorem České republice (online nebo na místě) je určeno inženýrům, kteří si přejí nastavit a nasadit systém Apache Spark pro zpracování velmi rozsáhlých dat.
Po ukončení tohoto kurzu budou účastníci schopni:
- Nainstalovat a nakonfigurovat Apache Spark.
- Rychle zpracovávat a analyzovat velmi rozsáhlé datové sady.
- Porozumět rozdílům mezi Apache Sparkem a Hadoop MapReduce a vědět, kdy který nástroj použít.
- Integrovat Apache Spark s dalšími nástroji pro strojové učení.
Správa Apache Sparku
35 HodinyToto školení vedené instruktorem v <lok> (online nebo na místě) je určeno pro systémové administrátory s začátečnickou až středně pokročilou úrovní znalostí, kteří chtějí nasazovat, udržovat a optimalizovat Spark clustery.
Po absolvování tohoto školení budou účastníci schopni:
- Nainstalovat a nakonfigurovat Apache Spark v různých prostředích.
- Správně spravovat zdroje clusteru a monitorovat běžící Spark aplikace.
- Optimalizovat výkon Spark clusterů.
- Implementovat bezpečnostní opatření a zajistit vysokou dostupnost systému.
- Diagnostikovat a řešit běžné problémy spojené se Sparkem.
Apache Spark v cloudu
21 HodinyNa začátku si osvojení Apache Sparku vyžaduje určité úsilí a učení se může zdát náročnější. Tento kurz má za cíl pomoci účastníkům tuto obtížnou fázi překonat. Po absolvování kurzu budou mít základní znalosti o Apache Sparku – dokážou rozlišit RDD od DataFrame, seznámí se s rozhraními v Pythonu a Scala, pochopí koncepty exekutorů a úloh atd. Kurz se také zaměřuje na osvědčené postupy při nasazování do cloudu – konkrétně na platformy Databricks a AWS. Účastníci si dále osvojí rozdíly mezi službami AWS EMR a AWS Glue, která je nejnovější službou Sparku od společnosti Amazon.
KDO JE KURZ URČEN:
Inženýři dat, odborníci na DevOps, data scientista
Python a Spark pro práci s velkými daty (PySpark)
21 HodinyV tomto školení pod vedením instruktora se účastníci naučí, jak společně použít Python a Spark k analýze velkých dat na základě praktických cvičení.
Na konci tohoto kurzu budou schopni:
- Používat Spark společně s Pythonem k analýze velkých dat.
- Zpracovávat cvičení, která simulují reálné pracovní situace.
- Využívat různé nástroje a techniky pro analýzu velkých dat pomocí PySpark.
Python, Spark a Hadoop pro práci s velkými daty
21 HodinyToto školení vedené instruktorem v České republice (online či na místě) je určeno vývojářům, kteří chtějí využívat a integrovat Spark, Hadoop a Python k zpracování, analýze a transformaci rozsáhlých a složitých datových souborů.
Po absolvování tohoto kurzu budou účastníci schopni:
- Nastavit potřebné prostředí pro zahájení zpracování velkých dat pomocí Sparku, Hadoopu a Pythonu.
- Porozumět vlastnostem, klíčovým komponentám a architektuře Sparku a Hadoopu.
- Naučit se integrovat Spark, Hadoop a Python pro zpracování velkých dat.
- Poznat nástroje v rámci ekosystému Sparku (Spark MLlib, Spark Streaming, Kafka, Sqoop a Flume).
- Vytvořit doporučovací systémy založené na kolaborativní filtraci podobné těm u Netflixu, YouTube, Amazonu, Spotify či Googlu.
- Využít Apache Mahout k škálování algoritmů strojového učení.
Stratio: Moduly Rocket a Intelligence s využitím PySpark
14 HodinyStratio je datově orientovaná platforma, která v jediném řešení spojuje velká data, umělou inteligenci a správu dat. Díky svým modulům Rocket a Intelligence umožňuje rychlou exploraci dat, jejich transformaci a pokročilou analýzu v podnikovém prostředí.
Tento kurz vedený instruktorem (online nebo na místě) je určen pro data profesionály střední úrovně, kteří chtějí efektivně využívat moduly Rocket a Intelligence ve Stratiu s pomocí PySpark. Zaměřuje se na cykly, uživatelsky definované funkce a pokročilou datovou logiku.
Po absolvování tohoto kurzu budou účastníci schopni:
- Orientovat se a pracovat na platformě Stratio s využitím modulů Rocket a Intelligence.
- Využívat PySpark při načítání, transformaci a analýze dat.
- Používat cykly a podmínkovou logiku k řízení toků dat a vytváření funkcí pro zpracování dat.
- Vytvářet a spravovat uživatelsky definované funkce (UDF) pro opakované použití v PySpark.
Formát kurzu
- Interaktivní přednášky a diskuze.
- Bohatá množství cvičení a praktických úkolů.
- Praktické implementace v živém laboratorním prostředí.
Možnosti přizpůsobení kurzu
- Chcete-li si vyžádat individuálně připravený kurz, kontaktujte nás za účelem domluvy.