Talend Big Data Integration Počítačový Kurz
Talend Open Studio for Big Data je open source ETL nástroj pro zpracování big data. Zahrnuje vývojové prostředí pro práci s big data zdroji a cíli a spouštění úloh bez nutnosti psát kód.
Tuto instruktor-vedenou živou školení (online nebo na místě) je určeno technickým osobám, které chtějí nasadit Talend Open Studio for Big Data pro zjednodušení procesu čtení a zpracování big data.
Na konci tohoto školení budou účastníci schopni:
- Nainstalovat a nakonfigurovat Talend Open Studio for Big Data.
- Připojit se k big data systémům, jako jsou Cloudera, HortonWorks, MapR, Amazon EMR a Apache.
- Porozumět a nastavit komponenty a připojení Open Studio pro big data.
- Nakonfigurovat parametry pro automatické generování MapReduce kódu.
- Použít rozhraní Open Studio pro přetahování a spouštění Hadoop úloh.
- Prototypovat big data kanály.
- Automatizovat big data integrační projekty.
Formát kurzu
- Interaktivní přednáška a diskuse.
- Množství cvičení a praktické praxe.
- Praktická implementace v živém laboratorním prostředí.
Možnosti přizpůsobení kurzu
- Pokud si přejete vytvořit přizpůsobené školení pro tento kurz, kontaktujte nás k domluvě.
Návrh Školení
Úvod
Přehled funkcí a architektury „Open Studio for Big Data“
Nastavení Open Studio pro big data
Navigace v uživatelském rozhraní
Porozumění komponentám a připojením big data
Připojení k Hadoop clusteru
Čtení a zápis dat
Zpracování dat pomocí Hive a MapReduce
Analýza výsledků
Zlepšení kvality big data
Vytvoření big data kanálu
Správa uživatelů, skupin, rolí a projektů
Nasazení Open Studio do produkce
Monitorování Open Studio
Řešení potíží
Shrnutí a závěr
Požadavky
- Pochopení vztahových databází
- Pochopení datových skladů
- Pochopení konceptů ETL (Extract, Transform, Load)
Cílová skupina
- Odborníci na business intelligence
- Odborníci na databáze
- SQL vývojáři
- ETL vývojáři
- Řešení architektů
- Data architekti
- Odborníci na datové skladovy
- Správci systémů a integrátoři
Veřejné školení vyžaduje minimálně 5 účastníků.
Talend Big Data Integration Počítačový Kurz - Rezervace
Talend Big Data Integration Počítačový Kurz - Dotaz
Talend Big Data Integration - Dotaz ohledně konzultace
Reference (1)
Praktické cvičení. Třída by měla trvat 5 dní, ale i tři dny pomohly rozjasnit spoustu otázek, které jsem měl z práce s NiFi.
James - BHG Financial
Kurz - Apache NiFi for Administrators
Přeloženo strojem
Nadcházející kurzy
Související kurzy
Pokročilé použití Apache Iceberg
21 HodinyTento instruktorem vedený, živý kurz v České republice (online nebo na místě) je zaměřen na pokročilé dataové odborníky, kteří chtějí optimalizovat pracovní postupy zpracování dat, zajistit integrity dat a implementovat robustní řešení pro data lakes, která mohou vypořádat s komplexností moderních aplikací na velkých datech.
Na konci tohoto kurzu budou účastníci schopni:
- Získat hluboké pochopení architektury Icebergu, včetně správy metadat a uspořádání souborů.
- Nakonfigurovat Iceberg pro optimální výkon ve různých prostředích a integrovat ho s více datovými procesními enginami.
- Spravovat velké tabulky Iceberg, provádět komplexní změny schémat a zpracovávat evoluci oddílů.
- Ovládat techniky pro optimalizaci výkonu dotazů a efektivitu čtení dat pro velké soubory dat.
- Implementovat mechanismy k zajištění konzistence dat, správě transakčních záruk a řešení selhání v distribuovaných prostředích.
Základy Apache Iceberg
14 HodinyToto vedené školení na živou v České republice (online nebo na místě) je určeno začínajícím datovým profesionálům, kteří se chtějí naučit efektivně využívat Apache Iceberg pro správu velkých datových souborů, zajištění integrity dat a optimalizaci pracovních postupů při zpracování dat.
Na konci tohoto školení budou účastníci schopni:
- Důkladně pochopit architekturu, funkce a výhody Apache Iceberg.
- Seznámit se s formáty tabulek, rozdělováním, evolucí schémat a funkcemi časového cestování.
- Nainstalovat a nakonfigurovat Apache Iceberg v různých prostředích.
- Vytvářet, spravovat a manipulovat s tabulkami Iceberg.
- Porozumět procesu migrování dat z jiných formátů tabulek do Iceberg.
Big Data Analytics s Google Colab a Apache Spark
14 HodinyTento instruktážní živý kurz (na místě nebo online) je určen pro středně pokročilé datové vědce a inženýry, kteří chtějí použít Google Colab a Apache Spark pro zpracování velkých dat a analytiku.
Po ukončení tohoto kurzu budou účastníci schopni:
- Nastavit prostředí pro velká data pomocí Google Colab a Sparku.
- Efektivně zpracovat a analyzovat výrazné datové sady pomocí Apache Spark.
- Visualizovat velká data ve spolupracovném prostředí.
- Integrace Apache Spark se cloudovými nástroji.
Apache NiFi pro Správce
21 HodinyApache NiFi je open-source platforma pro tokovou integraci dat a zpracování událostí. Umožňuje automatizované, v reálném čase probíhající směrování dat, transformaci a mediatorku systémů mezi různými platformami s webovým uživatelským rozhraním a detailní kontrolou.
Tato školení vedená instruktorem (na místě nebo zdálky) je určená středně pokročilým správcům a inženýrům, kteří chtějí nasadit, spravovat, zabezpečit a optimalizovat NiFi toky dat v produkčních prostředích.
Na konci tohoto školení budou účastníci schopni:
- Nainstalovat, nakonfigurovat a udržovat Apache NiFi clustery.
- Naprojektovat a spravovat toky dat z různých zdrojů a cílů.
- Implementovat automatizaci toku, směrování a transformační logiku.
- Optimalizovat výkon, monitorovat operace a řešit problémy.
Formát kurzu
- Interaktivní přednáška s diskusí o reálných architekturách.
- Praktické cvičení: vytváření, nasazování a správa toků.
- Scénáře založená cvičení v prostředí live-labu.
Možnosti přizpůsobení kurzu
- Pro požadavek na přizpůsobené školení se prosím obrátěte k nám, abychom to zařídili.
PySpark a strojové učení
21 HodinyTento kurz poskytuje praktický úvod do tvorby škálovatelných pracovních postupů zpracování dat a strojového učení pomocí PySparku. Účastníci se naučí, jak Apache Spark funguje v rámci moderních ekosystémů pro práci s velkými daty, a jak efektivně zpracovávat rozsáhlé datové sady pomocí principů distribuovaného výpočtu.
Základy Apache Spark
21 HodinyTato vedená školení na místě (online nebo na místě) je určená inženýrům, kteří chtějí nastavit a nasadit systém Apache Spark pro zpracování velmi velkých objemů dat.
Na konci tohoto školení budou účastníci schopni:
- Nainstalovat a nakonfigurovat Apache Spark.
- Rychle zpracovávat a analyzovat velmi velké soubory dat.
- Pochopit rozdíly mezi Apache Sparkem a Hadoop MapReduce a kdy se který používá.
- Integrovat Apache Spark s jinými nástroji pro strojové učení.
Správa Apache Spark
35 HodinyToto živé školení vedené instruktorem v České republice (online nebo na místě) je zaměřeno na začátečníky až středně pokročilé správce systému, kteří chtějí nasazovat, udržovat a optimalizovat clustery Spark.
Na konci tohoto školení budou účastníci schopni:
- Nainstalujte a nakonfigurujte Apache Spark v různých prostředích.
- Spravujte prostředky clusteru a monitorujte aplikace Spark.
- Optimalizujte výkon clusterů Spark.
- Implementujte bezpečnostní opatření a zajistěte vysokou dostupnost.
- Ladění a odstraňování běžných problémů se Sparkem.
Apache Spark v cloudu
21 HodinyKřivka učení Apache Spark se na začátku pomalu zvyšuje, potřebuje hodně úsilí, aby se první vrátil. Tento kurz si klade za cíl proskočit první náročnou částí. Po absolvování tohoto kurzu účastníci porozumí základům Apache Spark, jasně odliší RDD od DataFrame, naučí se Python a Scala API, porozumí exekutorům a úkolům atd. Tento kurz také důsledně dodržuje doporučené postupy se zaměřuje na cloudové nasazení, Databricks a AWS. Studenti také porozumí rozdílům mezi AWS EMR a AWS Glue, jednou z nejnovějších služeb Spark společnosti AWS.
PUBLIKUM:
Data Engineer, DevOps, Data Scientist
Python a Spark pro Velká Data (PySpark)
21 HodinyV tomto živém školení pod vedením instruktora v České republice se účastníci naučí, jak používat Python a Spark společně k analýze velkých dat při práci na praktických cvičeních.
Na konci tohoto školení budou účastníci schopni:
- Naučte se používat Spark s Python k analýze Big Data.
- Pracujte na cvičeních, která napodobují případy ze skutečného světa.
- Použijte různé nástroje a techniky pro analýzu velkých dat pomocí PySpark.
Python, Spark a Hadoop pro Velká Data
21 HodinyToto živé školení vedené instruktorem v České republice (online nebo na místě) je zaměřeno na vývojáře, kteří chtějí používat a integrovat Spark, Hadoop a Python ke zpracování, analýze a transformaci velkých a komplexních souborů dat.
Na konci tohoto školení budou účastníci schopni:
- Nastavte potřebné prostředí pro zahájení zpracování velkých dat pomocí Spark, Hadoop a Python.
- Pochopte funkce, základní komponenty a architekturu Spark a Hadoop.
- Naučte se, jak integrovat Spark, Hadoop a Python pro zpracování velkých dat.
- Prozkoumejte nástroje v ekosystému Spark (Spark MlLib, Spark Streaming, Kafka, Sqoop, Kafka a Flume).
- Vytvářejte systémy doporučení pro společné filtrování podobné jako Netflix, YouTube, Amazon, Spotify a Google.
- Použijte Apache Mahout ke škálování algoritmů strojového učení.
Stratio: Rocket a Intelligence Moduly s PySpark
14 HodinyStratio je datově orientovaná platforma, která integruje big data, umělou inteligenci (AI) a řízení do jednotného řešení. Její moduly Rocket a Intelligence umožňují rychlé prozkoumávání, transformaci a pokročilé analýzy dat v podnikových prostředích.
Tato instruktorem vedena živá školení (online nebo na místě) je určená pro středně pokročilé odborníky na data, kteří chtějí efektivně používat moduly Rocket a Intelligence v Stratio s PySpark, s důrazem na smyčkové struktury, uživatelsky definované funkce (UDFs) a pokročilou datovou logiku.
Na konci tohoto školení budou účastníci schopni:
- Navigovat a pracovat v platformě Stratio pomocí modulů Rocket a Intelligence.
- Používat PySpark ve kontextu ingesta, transformace a analýzy dat.
- Využívat smyčky a podmíněnou logiku k řízení pracovních postupů s daty a úloh předzpracování dat.
- Vytvářet a spravovat uživatelsky definované funkce (UDFs) pro opakovatelné operace s daty v PySpark.
Formát kurzu
- Interaktivní přednáška a diskuse.
- Mnoho cvičení a praxe.
- Praktické implementace v živém laboratorním prostředí.
Možnosti přizpůsobení kurzu
- Pro požadavek na přizpůsobené školení tohoto kurzu, prosím nás kontaktujte pro domluvu.
Talend Administration Center (TAC)
14 HodinyTato vedená školení (online nebo osobně) je určena systémovým správcům, odborníkům na data a analytikům, kteří chtějí nastavit Talend Administration Center pro nasazení a správu rolí a úkolů organizace.
Konec školení budou účastníci schopni:
- Nainstalovat a nakonfigurovat Talend Administration Center.
- Porozumět a implementovat základním principům správy Talendu.
- Vytvářet, nasazovat a spouštět obchodní projekty nebo úkoly v Talendu.
- Sledovat zabezpečení datových souborů a vyvíjet obchodní rutiny na základě frameworku TAC.
- Získat širší pochopení aplikací big data.
Talend Data Stewardship
14 HodinyTato instruktorem vedená živá školení v České republice (online nebo přítomně) je určena začínajícím až středně pokročilým analytikům dat, kteří chtějí rozšířit své znalosti a dovednosti v řízení a zlepšování kvality dat pomocí Talend Data Stewardship.
Na konci tohoto školení budou účastníci schopni:
- Získat komplexní představu o roli řízení dat v udržování kvality dat.
- Používat Talend Data Stewardship pro správu úkolů souvisejících s kvalitou dat.
- Vytvářet, přiřazovat a spravovat úkoly v rámci Talend Data Stewardship, včetně přizpůsobení pracovních postupů.
- Používat možnosti sestavování a monitorování nástroje k sledování kvality dat a úsilí o řízení dat.
Talend Open Studio for ESB
21 HodinyV tomto instruktorem vedeném, živém školení v České republice se účastníci naučí, jak používat Talend Open Studio pro ESB k vytváření, připojování, spřádání a správě služeb a jejich interakcí.
Na konci tohoto školení budou účastníci schopni:
- Integrovat, rozšiřovat a dodávat technologie ESB jako jednotné balíky v různých prostředích nasazení.
- Porozumět a efektivně používat nejčastěji používané komponenty Talend Open Studio.
- Integrovat jakoukoli aplikaci, databázi, API nebo webové služby.
- Ladně integrovat různorodé systémy a aplikace.
- Vkládat existující knihovny Java kódu do projektů.
- Používat komunitní komponenty a kód k rozšiřování projektů.
- Rychle integrovat systémy, aplikace a zdroje dat v prostředí s přetažením a pustěním (drag-and-drop) v Eclipse.
- Snížit čas na vývoj a náklady na údržbu generováním optimalizovaného, znovupoužitelného kódu.