Děkujeme za vaši dotaz! Jeden z našich pracovníků vás brzy kontaktuje.
Děkujeme za rezervaci! Jeden z našich pracovníků vás brzy kontaktuje.
Návrh Školení
Každá schůzka trvá 2 hodiny
Den 1: Schůzka 1: Přehled obchodní výhody Business Intelligence v oblasti Big Data ve vládě
- Kazusy z NIH, DoE
- Rychlost adaptace Big Data ve vládě a jak agentury zarovnávají svou budoucí činnost kolem prediktivní analýzy Big Data
- Rozsáhlé oblasti aplikace v DoD, NSA, IRS, USDA atd.
- Propojení Big Data s legacy daty
- Základní pochopení podporných technologií v prediktivní analýze
- Integrace dat a vizualizace dashboardů
- Správa podvodů
- Generování obchodních pravidel/detekce podvodů
- Detekce a profilování hrozeb
- Analýza nákladů a přínosů implementace Big Data
Den 1: Schůzka 2: Úvod do Big Data-1
- Hlavní charakteristiky Big Data – objem, rozmanitost, rychlost a pravdivost. Architektura MPP pro objem.
- Datové sklady – statické schéma, pomalu se vyvíjející sady dat
- MPP databáze, jako jsou Greenplum, Exadata, Teradata, Netezza, Vertica atd.
- Řešení založená na Hadoopu – žádné podmínky na strukturu sady dat.
- Typický vzor: HDFS, MapReduce (crunch), načtení z HDFS
- Batch – vhodné pro analytické/neinteraktivní aplikace
- Objem: Streamování dat CEP
- Typické volby – produkty CEP (např. Infostreams, Apama, MarkLogic atd.)
- Méně produkčně připravené – Storm/S4
- NoSQL databáze – (sloupcové a klíč-hodnota): Nejvhodnější jako analytické doplnění datového skladu/databáze
Den 1 : Schůzka 3 : Úvod do Big Data-2
NoSQL řešení
- KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
- KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
- KV Store (hierarchické) - GT.m, Cache
- KV Store (seřazené) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
- KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
- Tuple Store - Gigaspaces, Coord, Apache River
- Object Database - ZopeDB, DB40, Shoal
- Document Store - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
- Wide Columnar Store - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI
Rozmanitost dat: Úvod do čištění dat v Big Data
- RDBMS – statická struktura/schéma, nepodporuje agilní, experimentální prostředí.
- NoSQL – polostrukturovaná data, dostatečná struktura k ukládání dat bez přesného schématu před uložením
- Problémy čištění dat
Den 1 : Schůzka 4 : Úvod do Big Data-3 : Hadoop
- Kdy vybrat Hadoop?
- STRUKTUROVANÁ DATA - Enterprise datové sklady/databáze mohou ukládat masivní data (za cenu), ale vnucují strukturu (není dobré pro aktivní průzkum)
- POLOSTRUKTUROVANÁ DATA – obtížné řešit tradičními řešením (DW/DB)
- Ukládání dat do skladu = OBRLVSKÝ úsilí a statické i po implementaci
- Pro rozmanitost a objem dat, zpracovaných na komoditním hardwaru – HADOOP
- Komoditní H/W potřebné k vytvoření Hadoop clusteru
Úvod do Map Reduce /HDFS
- MapReduce – distribuce výpočtů na více serverů
- HDFS – zpřístupnění dat lokálně pro výpočetní proces (s redundantou)
- Data – mohou být nestrukturovaná/bez schématu (na rozdíl od RDBMS)
- Odpovědnost vývojáře je dát datům smysl
- Programování MapReduce = práce s Javou (výhody/nevýhody), manuální načítání dat do HDFS
Den 2: Schůzka 1: Ekosystém Big Data - Budování Big Data ETL: vesmír nástrojů Big Data – který použít a kdy?
- Hadoop vs. ostatní NoSQL řešení
- Pro interaktivní, náhodný přístup k datům
- Hbase (sloupcová databáze) nad Hadoop
- Náhodný přístup k datům, ale s omezeními (max 1 PB)
- Není dobré pro ad-hoc analýzy, dobré pro logování, počítání, časové řady
- Sqoop - Import z databází do Hive nebo HDFS (přístup JDBC/ODBC)
- Flume – Streamování dat (např. log data) do HDFS
Den 2: Schůzka 2: Systém pro správu Big Data
- Pohyblivé části, spuštění/selhání výpočetních uzlů: ZooKeeper - Pro konfiguraci/koordinaci/jmenovací služby
- Komplexní pipeline/workflow: Oozie – správa workflow, závislostí, řetězení
- Nasazení, konfigurace, správa clusteru, aktualizace atd. (systémový správce) : Ambari
- Ve cloudu : Whirr
Den 2: Schůzka 3: Prediktivní analýza v Business Intelligence -1: Základní techniky a BI na bázi strojového učení :
- Úvod do strojového učení
- Učení klasifikačních technik
- Bayesovská predikce - příprava trénovacího souboru
- Machine Learning Support Vector Machine
- KNN p-Tree Algebra a vertikální dobývání
- Neuronová síť
- Problém velkých proměnných v Big Data – Náhodný les (RF)
- Problém automatizace v Big Data – Soubor více modelů RF
- Automatizace přes Soft10-M
- Text analytický nástroj – Treeminer
- Agilní učení
- Učení založené na agentech
- Distribuované učení
- Úvod do open source nástrojů pro prediktivní analýzu: R, Rapidminer, Mahut
Den 2: Schůzka 4 Prediktivní analýza eco-system-2: Časté problémy prediktivní analýzy ve vládě.
- Insight analýza
- Vizualizační analýza
- Strukturovaná prediktivní analýza
- Nestrukturovaná prediktivní analýza
- Profilování hrozeb/podvodníků/dodavatelů
- Doporučovací engine
- Detekce vzorů
- Objevování pravidel/scénářů – selhání, podvod, optimalizace
- Objevování příčin
- Analýza sentimentu
- CRM analýza
- Síťová analýza
- Text analýza
- Techology assisted review
- Analýza podvodů
- Reálná časová analýza
Den 3 : Schůzka 1 : Reálná časová a škálovatelná analýza přes Hadoop
- Proč běžné analytické algoritmy selhávají v Hadoop/HDFS
- Apache Hama - pro Bulk Synchronous distribuované výpočty
- Apache SPARK - pro clusterové výpočty pro reálnou časovou analýzu
- CMU Graphics Lab2 - Grafem založený asynchronní přístup k distribuovaným výpočtům
- KNN p-Algebra založený přístup od Treeminer pro snížení hardwarových nákladů na provoz
Den 3: Schůzka 2: Nástroje pro eDiscovery a forenztiku
- eDiscovery nad Big Data vs. Legacy data – srovnání nákladů a výkonu
- Prediktivní kódování a technologie assisted review (TAR)
- Live demo produktu Tar (vMiner) k pochopení, jak TAR funguje pro rychlejší discovery
- Rychlejší indexace přes HDFS – rychlost dat
- NLP nebo zpracování přirozeného jazyka – různé techniky a open source produkty
- eDiscovery ve cizích jazycích - technologie pro zpracování cizích jazyků
Den 3 : Schůzka 3: Big Data BI pro kybernetickou bezpečnost – pochopení celkového pohledu 360 stupňů od rychlého sběru dat po identifikaci hrozeb
- Pochopení základů security analýzy - attack surface, security misconfiguration, host defenses
- Síťová infrastruktura/Velká datová roura/Response ETL pro reálnou časovou analýzu
- Preskriptivní vs prediktivní – Fixní pravidla vs automatický objev pravidel hrozeb z Meta dat
Den 3: Schůzka 4: Big Data v USDA : Aplikace v zemědělství
- Úvod do IoT (Internet of Things) pro zemědělství - senzorová Big Data a řízení
- Úvod do satelitního snímání a jeho aplikace v zemědělství
- Integrace senzorových a obrazových dat pro plodnost půdy, doporučení ke pěstování a predikce
- Pojištění zemědělství a Big Data
- Predikce ztráty úrody
Den 4 : Schůzka 1: Prevence podvodů BI z Big Data ve vládě- Analýza podvodů:
- Základní klasifikace analýzy podvodů- pravidla vs prediktivní analýza
- Dohledné vs nedohledné Machine Learning pro detekci vzorů podvodů
- Podvod dodavatele/přepalování za projekty
- Podvody Medicare a Medicaid- techniky detekce podvodů při zpracování nároků
- Podvody při náhradě cestovních výdajů
- Podvody při refundaci IRS
- Kazuistiky a live demo budou předvedeny tam, kde jsou data k dispozici.
Den 4 : Schůzka 2: Sociální média Analýza- Sběr a analýza informací
- Big Data ETL API pro extrakci dat ze sociálních médií
- Text, obrázek, meta data a video
- Analýza sentimentu ze sociálních mediálních feedů
- Kontextové a nekonzextové filtrování feedů sociálních médií
- Sociální media Dashboard pro integraci rozmanitých sociálních médií
- Automatické profilování profilů sociálních médií
- Live demo každé analýzy bude předvedeno skrze nástroj Treeminer.
Den 4 : Schůzka 3: Big Data Analýza v zpracování obrazů a video feedech
- Techniky ukládání obrázků v Big Data- Řešení úložiště pro data přesahující petabajty
- LTFS a LTO
- GPFS-LTFS (Vrstevnaté řešení úložiště pro Big image data)
- Základy analýzy obrázků
- Rozpoznávání objektů
- Sekvestace obrázků
- Sledování pohybu
- 3-D rekonstrukce obrazu
Den 4: Schůzka 4: Aplikace Big Data v NIH:
- Vznikající oblasti Bio-informatiky
- Meta-genomika a problémy s dobýváním Big Data
- Big Data Prediktivní analýza pro Farmakogenomiku, Metabolomiku a Proteomiku
- Big Data v downstream Genomics procesu
- Aplikace Big data prediktivní analýzy v veřejném zdraví
Big Data Dashboard pro rychlou přístupnost rozmanitých dat a zobrazení :
- Integrace existující platformy aplikací s Big Data Dashboard
- Správa Big Data
- Kazus studie Big Data Dashboard: Tableau a Pentaho
- Použijte Big Data app k podpoře lokalizovaných služeb ve vládě.
- Systém sledování a správy
Den 5 : Schůzka 1: Jak ospravedlnit implementaci Big Data BI v organizaci:
- Definice ROI pro implementaci Big Data
- Kazuistiky pro úsporu času analytiků pro sběr a přípravu Dat – nárůst zisku produktivity
- Kazuistiky zisku příjmů z úspory nákladů na licencované databáze
- Zisk příjmů z lokalizovaných služeb
- Úspora z prevence podvodů
- Integrovaný přístup tabulkových aplikací pro výpočet přibližných nákladů vs. Zisk příjmů/úspor z implementace Big Data.
Den 5 : Schůzka 2: Postup krok za krokem pro nahrazení legacy datového systému Big Data Systémem:
- Pochopení praktické Big Data Migrate Roadmap
- Jaké jsou důležité informace potřebné před návrhem implementace Big Data
- Jaké jsou různé způsoby výpočtu objemu, rychlosti, rozmanitosti a pravdivosti dat
- Jak odhadnout růst dat
- Kazuistiky
Den 5: Schůzka 4: Přehled Big Data dodavatelů a přehled jejich produktů. Sesí Q/A:
- Accenture
- APTEAN (dříve CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB (dříve 10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware (součást EMC)
Požadavky
- Základní znalost podniku a datových systémů ve vládě v dané oblasti
- Základní porozumění SQL/Oracle nebo relační databáze
- Základní porozumění statistice (na úrovni tabulkových aplikací)
35 Hodiny
Reference (1)
Schopnost vedenáře vyhovět požadavkům organizace při přizpůsobení kurzu, a ne jen ho poskytnout pro formální splnění povinnosti.
Masilonyane - Revenue Services Lesotho
Kurz - Big Data Business Intelligence for Govt. Agencies
Přeloženo strojem