Zkuste nás kontaktovat

Návrh Školení

Každá schůzka trvá 2 hodiny

Den 1: Schůzka 1: Přehled obchodní výhody Business Intelligence v oblasti Big Data ve vládě

  • Kazusy z NIH, DoE
  • Rychlost adaptace Big Data ve vládě a jak agentury zarovnávají svou budoucí činnost kolem prediktivní analýzy Big Data
  • Rozsáhlé oblasti aplikace v DoD, NSA, IRS, USDA atd.
  • Propojení Big Data s legacy daty
  • Základní pochopení podporných technologií v prediktivní analýze
  • Integrace dat a vizualizace dashboardů
  • Správa podvodů
  • Generování obchodních pravidel/detekce podvodů
  • Detekce a profilování hrozeb
  • Analýza nákladů a přínosů implementace Big Data

Den 1: Schůzka 2: Úvod do Big Data-1

  • Hlavní charakteristiky Big Data – objem, rozmanitost, rychlost a pravdivost. Architektura MPP pro objem.
  • Datové sklady – statické schéma, pomalu se vyvíjející sady dat
  • MPP databáze, jako jsou Greenplum, Exadata, Teradata, Netezza, Vertica atd.
  • Řešení založená na Hadoopu – žádné podmínky na strukturu sady dat.
  • Typický vzor: HDFS, MapReduce (crunch), načtení z HDFS
  • Batch – vhodné pro analytické/neinteraktivní aplikace
  • Objem: Streamování dat CEP
  • Typické volby – produkty CEP (např. Infostreams, Apama, MarkLogic atd.)
  • Méně produkčně připravené – Storm/S4
  • NoSQL databáze – (sloupcové a klíč-hodnota): Nejvhodnější jako analytické doplnění datového skladu/databáze

Den 1 : Schůzka 3 : Úvod do Big Data-2

NoSQL řešení

  • KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
  • KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
  • KV Store (hierarchické) - GT.m, Cache
  • KV Store (seřazené) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
  • KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
  • Tuple Store - Gigaspaces, Coord, Apache River
  • Object Database - ZopeDB, DB40, Shoal
  • Document Store - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
  • Wide Columnar Store - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI

Rozmanitost dat: Úvod do čištění dat v Big Data

  • RDBMS – statická struktura/schéma, nepodporuje agilní, experimentální prostředí.
  • NoSQL – polostrukturovaná data, dostatečná struktura k ukládání dat bez přesného schématu před uložením
  • Problémy čištění dat

Den 1 : Schůzka 4 : Úvod do Big Data-3 : Hadoop

  • Kdy vybrat Hadoop?
  • STRUKTUROVANÁ DATA - Enterprise datové sklady/databáze mohou ukládat masivní data (za cenu), ale vnucují strukturu (není dobré pro aktivní průzkum)
  • POLOSTRUKTUROVANÁ DATA – obtížné řešit tradičními řešením (DW/DB)
  • Ukládání dat do skladu = OBRLVSKÝ úsilí a statické i po implementaci
  • Pro rozmanitost a objem dat, zpracovaných na komoditním hardwaru – HADOOP
  • Komoditní H/W potřebné k vytvoření Hadoop clusteru

Úvod do Map Reduce /HDFS

  • MapReduce – distribuce výpočtů na více serverů
  • HDFS – zpřístupnění dat lokálně pro výpočetní proces (s redundantou)
  • Data – mohou být nestrukturovaná/bez schématu (na rozdíl od RDBMS)
  • Odpovědnost vývojáře je dát datům smysl
  • Programování MapReduce = práce s Javou (výhody/nevýhody), manuální načítání dat do HDFS

Den 2: Schůzka 1: Ekosystém Big Data - Budování Big Data ETL: vesmír nástrojů Big Data – který použít a kdy?

  • Hadoop vs. ostatní NoSQL řešení
  • Pro interaktivní, náhodný přístup k datům
  • Hbase (sloupcová databáze) nad Hadoop
  • Náhodný přístup k datům, ale s omezeními (max 1 PB)
  • Není dobré pro ad-hoc analýzy, dobré pro logování, počítání, časové řady
  • Sqoop - Import z databází do Hive nebo HDFS (přístup JDBC/ODBC)
  • Flume – Streamování dat (např. log data) do HDFS

Den 2: Schůzka 2: Systém pro správu Big Data

  • Pohyblivé části, spuštění/selhání výpočetních uzlů: ZooKeeper - Pro konfiguraci/koordinaci/jmenovací služby
  • Komplexní pipeline/workflow: Oozie – správa workflow, závislostí, řetězení
  • Nasazení, konfigurace, správa clusteru, aktualizace atd. (systémový správce) : Ambari
  • Ve cloudu : Whirr

Den 2: Schůzka 3: Prediktivní analýza v Business Intelligence -1: Základní techniky a BI na bázi strojového učení :

  • Úvod do strojového učení
  • Učení klasifikačních technik
  • Bayesovská predikce - příprava trénovacího souboru
  • Machine Learning Support Vector Machine
  • KNN p-Tree Algebra a vertikální dobývání
  • Neuronová síť
  • Problém velkých proměnných v Big Data – Náhodný les (RF)
  • Problém automatizace v Big Data – Soubor více modelů RF
  • Automatizace přes Soft10-M
  • Text analytický nástroj – Treeminer
  • Agilní učení
  • Učení založené na agentech
  • Distribuované učení
  • Úvod do open source nástrojů pro prediktivní analýzu: R, Rapidminer, Mahut

Den 2: Schůzka 4 Prediktivní analýza eco-system-2: Časté problémy prediktivní analýzy ve vládě.

  • Insight analýza
  • Vizualizační analýza
  • Strukturovaná prediktivní analýza
  • Nestrukturovaná prediktivní analýza
  • Profilování hrozeb/podvodníků/dodavatelů
  • Doporučovací engine
  • Detekce vzorů
  • Objevování pravidel/scénářů – selhání, podvod, optimalizace
  • Objevování příčin
  • Analýza sentimentu
  • CRM analýza
  • Síťová analýza
  • Text analýza
  • Techology assisted review
  • Analýza podvodů
  • Reálná časová analýza

Den 3 : Schůzka 1 : Reálná časová a škálovatelná analýza přes Hadoop

  • Proč běžné analytické algoritmy selhávají v Hadoop/HDFS
  • Apache Hama - pro Bulk Synchronous distribuované výpočty
  • Apache SPARK - pro clusterové výpočty pro reálnou časovou analýzu
  • CMU Graphics Lab2 - Grafem založený asynchronní přístup k distribuovaným výpočtům
  • KNN p-Algebra založený přístup od Treeminer pro snížení hardwarových nákladů na provoz

Den 3: Schůzka 2: Nástroje pro eDiscovery a forenztiku

  • eDiscovery nad Big Data vs. Legacy data – srovnání nákladů a výkonu
  • Prediktivní kódování a technologie assisted review (TAR)
  • Live demo produktu Tar (vMiner) k pochopení, jak TAR funguje pro rychlejší discovery
  • Rychlejší indexace přes HDFS – rychlost dat
  • NLP nebo zpracování přirozeného jazyka – různé techniky a open source produkty
  • eDiscovery ve cizích jazycích - technologie pro zpracování cizích jazyků

Den 3 : Schůzka 3: Big Data BI pro kybernetickou bezpečnost – pochopení celkového pohledu 360 stupňů od rychlého sběru dat po identifikaci hrozeb

  • Pochopení základů security analýzy - attack surface, security misconfiguration, host defenses
  • Síťová infrastruktura/Velká datová roura/Response ETL pro reálnou časovou analýzu
  • Preskriptivní vs prediktivní – Fixní pravidla vs automatický objev pravidel hrozeb z Meta dat

Den 3: Schůzka 4: Big Data v USDA : Aplikace v zemědělství

  • Úvod do IoT (Internet of Things) pro zemědělství - senzorová Big Data a řízení
  • Úvod do satelitního snímání a jeho aplikace v zemědělství
  • Integrace senzorových a obrazových dat pro plodnost půdy, doporučení ke pěstování a predikce
  • Pojištění zemědělství a Big Data
  • Predikce ztráty úrody

Den 4 : Schůzka 1: Prevence podvodů BI z Big Data ve vládě- Analýza podvodů:

  • Základní klasifikace analýzy podvodů- pravidla vs prediktivní analýza
  • Dohledné vs nedohledné Machine Learning pro detekci vzorů podvodů
  • Podvod dodavatele/přepalování za projekty
  • Podvody Medicare a Medicaid- techniky detekce podvodů při zpracování nároků
  • Podvody při náhradě cestovních výdajů
  • Podvody při refundaci IRS
  • Kazuistiky a live demo budou předvedeny tam, kde jsou data k dispozici.

Den 4 : Schůzka 2: Sociální média Analýza- Sběr a analýza informací

  • Big Data ETL API pro extrakci dat ze sociálních médií
  • Text, obrázek, meta data a video
  • Analýza sentimentu ze sociálních mediálních feedů
  • Kontextové a nekonzextové filtrování feedů sociálních médií
  • Sociální media Dashboard pro integraci rozmanitých sociálních médií
  • Automatické profilování profilů sociálních médií
  • Live demo každé analýzy bude předvedeno skrze nástroj Treeminer.

Den 4 : Schůzka 3: Big Data Analýza v zpracování obrazů a video feedech

  • Techniky ukládání obrázků v Big Data- Řešení úložiště pro data přesahující petabajty
  • LTFS a LTO
  • GPFS-LTFS (Vrstevnaté řešení úložiště pro Big image data)
  • Základy analýzy obrázků
  • Rozpoznávání objektů
  • Sekvestace obrázků
  • Sledování pohybu
  • 3-D rekonstrukce obrazu

Den 4: Schůzka 4: Aplikace Big Data v NIH:

  • Vznikající oblasti Bio-informatiky
  • Meta-genomika a problémy s dobýváním Big Data
  • Big Data Prediktivní analýza pro Farmakogenomiku, Metabolomiku a Proteomiku
  • Big Data v downstream Genomics procesu
  • Aplikace Big data prediktivní analýzy v veřejném zdraví

Big Data Dashboard pro rychlou přístupnost rozmanitých dat a zobrazení :

  • Integrace existující platformy aplikací s Big Data Dashboard
  • Správa Big Data
  • Kazus studie Big Data Dashboard: Tableau a Pentaho
  • Použijte Big Data app k podpoře lokalizovaných služeb ve vládě.
  • Systém sledování a správy

Den 5 : Schůzka 1: Jak ospravedlnit implementaci Big Data BI v organizaci:

  • Definice ROI pro implementaci Big Data
  • Kazuistiky pro úsporu času analytiků pro sběr a přípravu Dat – nárůst zisku produktivity
  • Kazuistiky zisku příjmů z úspory nákladů na licencované databáze
  • Zisk příjmů z lokalizovaných služeb
  • Úspora z prevence podvodů
  • Integrovaný přístup tabulkových aplikací pro výpočet přibližných nákladů vs. Zisk příjmů/úspor z implementace Big Data.

Den 5 : Schůzka 2: Postup krok za krokem pro nahrazení legacy datového systému Big Data Systémem:

  • Pochopení praktické Big Data Migrate Roadmap
  • Jaké jsou důležité informace potřebné před návrhem implementace Big Data
  • Jaké jsou různé způsoby výpočtu objemu, rychlosti, rozmanitosti a pravdivosti dat
  • Jak odhadnout růst dat
  • Kazuistiky

Den 5: Schůzka 4: Přehled Big Data dodavatelů a přehled jejich produktů. Sesí Q/A:

  • Accenture
  • APTEAN (dříve CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (dříve 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (součást EMC)

Požadavky

  • Základní znalost podniku a datových systémů ve vládě v dané oblasti
  • Základní porozumění SQL/Oracle nebo relační databáze
  • Základní porozumění statistice (na úrovni tabulkových aplikací)
 35 Hodiny

Počet účastníků


Cena za účastníka

Reference (1)

Nadcházející kurzy

Související kategorie