Zkuste nás kontaktovat

Návrh Školení

Den 1

Přehled obchodní inteligence využívající velká data pro analýzu kriminalistických informací

  • Případové studie z praxe – prediktivní policejní činnost
  • Míra přijetí technologií velkých dat v orgánech činných v trestním řízení a jejich plány pro budoucí využívání prediktivní analýzy na základě velkých dat
  • Nové technologické nástroje: senzory na detekci výstřelů, monitorovací video a sociální média
  • Využití technologií velkých dat k zmírnění přetížení informacemi
  • Propojení technologií velkých dat s tradičními systémy ukládání dat
  • Základní orientaci v technologiích umožňujících prediktivní analýzu
  • Integrace dat a vizualizace pomocí dashboardů
  • Správa podvodů
  • Obchodní pravidla a detekce podvodů
  • Detekce hrozeb a profilování potenciálních rizik
  • Analýza nákladů a přínosů spojených s implementací technologií velkých dat

Úvod do konceptu velkých dat

  • Hlavní charakteristiky velkých dat – objem, rozmanitost, rychlost a spolehlivost.
  • Architektura MPP (Masivně paralelní zpracování)
  • Datové sklady – statická struktura, pomalu se měnící datová sada
  • Databáze typu MPP: Greenplum, Exadata, Teradata, Netezza, Vertica apod.
  • Řešení založená na platformě Hadoop – nevyžadují předem definovanou strukturu datové sady.
  • Typický postup: HDFS, MapReduce (zpracování dat), následný výběr informací z HDFS
  • Apache Spark pro streamové zpracování dat
  • Dávkové zpracování – vhodné spíše pro analytické účely než interaktivní použití
  • Objem dat: CEP (Streamování událostí)
  • Běžné volby produktů pro streamování událostí – např. Infostreams, Apama, MarkLogic apod.
  • Méně rozvinutá řešení – Storm a S4
  • NoSQL databáze (sloupcová nebo klíč-hodnota) – vhodné jako doplněk k tradičním datovým skladům

Řešení typu NoSQL

  • Klíč-Hodnota: Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
  • Klíč-Hodnota: Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
  • Hierarchické klíč-hodnotové úložiště – GT.m, Cache
  • Seřazené klíč-hodnotové úložiště – TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
  • Cache určená k ukládání klíčů: Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
  • Úložiště typu tuple – Gigaspaces, Coord, Apache River
  • Objektové databáze – ZopeDB, DB40, Shoal
  • Dokumentová úložiště – CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
  • Široce používaná sloupcová úložiště – BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI

Různé typy dat: Úvod do problémů při čištění velkých datových sad

  • Relační databáze – mají pevnou strukturu; nepodporují flexibilní a experimentální přístup k datům.
  • NoSQL systémy – polostrukturované; poskytují dostatek struktury, aby bylo možné ukládat data i bez předchozí definice schématu.
  • Problémy při čištění dat

Hadoop

  • Kdy se Hadoop používá?
  • Strukturovaná data – firemní datové sklady a databáze umožňují ukládat obrovské množství informací (avšak za vysokou cenu), avšak vyžadují striktní strukturu, což není výhodné pro aktivní průzkum dat.
  • Polostrukturovaná data – jejich zpracování je s tradičními řešeními obtížné.
  • Ukládání velkých dat vyžaduje obrovské úsilí a po nastavení zůstává systém pevně daný.
  • Pro zpracování rozmanitých a rozsáhlých dat na běžném hardwaru je ideálním řešením Hadoop.
  • Vytvoření Hadoop clusteru vyžaduje pouze běžný počítačový hardware.

Úvod do MapReduce a HDFS

  • MapReduce – umožňuje distribuované zpracování dat přes více serverů.
  • HDFS – umožňuje lokální dostupnost dat pro výpočty s možností redundance.
  • Data mohou být nestrukturovaná či bez předem definovaného schématu (na rozdíl od relačních databází).
  • Je na vývojářích, aby data interpretovali.
  • Práce s MapReduce vyžaduje znalosti jazyka Java; je také nutné ručně načíst data do HDFS.

Den 2

Ekosystém velkých dat – budování procesů ETL (extrakce, transformace a nahrání) a výběr vhodných nástrojů pro práci s velkými daty

  • Hadoop vs. ostatní řešení typu NoSQL.
  • Interaktivní a rychlý přístup k datům.
  • HBase – sloupcově orientovaná databáze založená na platformě Hadoop.
  • Přístup k datům je možný, ale s omezením (maximální velikost 1 PB).
  • Nevhodná pro ad hoc analytické účely; využitelná spíše pro logování, počítání a časově závislé analýzy.
  • Sqoop – import dat ze standardních databázích do prostředí Hive nebo HDFS (podpora JDBC/ODBC).
  • Flume – přesun dat typu streamů (např. logovací data) do systému HDFS.

Systém pro správu velkých dat

  • Pohyblivé komponenty a neustále se měnící výpočetní uzly: ZooKeeper – určený k konfiguraci, koordinaci a pojmenování služeb.
  • Složité pracovní toky: Oozie – slouží ke správě postupů, vzájemných závislostí a řetězení úloh.
  • Nasazení, konfigurace, správa clusterů a jejich aktualizace (práce administrátora): Ambari.
  • Využití v cloudu: Whirr.

Prediktivní analýza – základní techniky a strojové učení v oblasti obchodní inteligence

  • Úvod do metod strojového učení.
  • Naučení se klasifikačním postupům.
  • Bayesovská predikce – příprava trénovacích dat.
  • Support Vector Machine.
  • Algebra p-Tree a vertikální těžení informací u algoritmu KNN.
  • Neuronové sítě.
  • Při práci s velkým počtem proměnných v rámci velkých dat se využívá metoda Random Forest (RF).
  • Automatizace procesů při zpracování velkého množství dat – vícemodelová kombinovaná varianta RF.
  • Automatizace pomocí nástroje Soft10-M.
  • Nástroj pro analýzu textu – Treeminer.
  • Elastické učení se na základě měnících se podmínek.
  • Učení s využitím agendových agentů.
  • Rozprostřené distribuované učení.
  • Seznámení s open-source nástroji pro prediktivní analýzu: R, Python, Rapidminer, Mahut.

Ekosystém prediktivní analýzy a jeho využití při analýze kriminalistických informací

  • Technologie a vyšetřovací procesy.
  • Analytické zpracávání poznatků.
  • Vizualizační analytika.
  • Strukturovaná prediktivní analýza.
  • Nestrukturovaná prediktivní analýza.
  • Profilování hrozeb, podvodů či dodavatelů.
  • Rekomendační systémy.
  • Detekce vzorců a tendencí.
  • Objevování pravidel a scénářů – zjištění příčin selhání, podvodů či optimalizace procesů.
  • Určení kořenových příčin problémů.
  • Analýza sentimentu (postojů a názorů).
  • Analytika CRM systémů.
  • Síťová analytika.
  • Textová analýza – získávání informací ze zápisů z výslechů, svědeckých výpovědí a příspěvků na internetu.
  • Pomocné technologie pro práci s velkým množstvím dat.
  • Analytika podvodů.
  • Reálná analytika v průběhu chodu systémů.

Den 3

Reálná a škálovatelná analýza dat nad platformou Hadoop

  • Důvody, proč běžné analytické algoritmy nefungují v prostředí Hadoop/HDFS.
  • Apache Hama – nástroj určený k masivně synchronnímu distribuovanému zpracování dat.
  • Apache Spark – platforma pro clusterové výpočty a reálnou analýzu velkých dat.
  • CMU Graphics Lab2 – metoda neasynchronního rozděleného zpracování pomocí grafů.
  • Algebra p-Tree od nástroje Treeminer – umožňuje snížit počet potřebných výpočetních zařízení při analýze velkých dat.

Nástroje pro elektronické vyhledávání důkazů a forenzní analýzu

  • Porovnání nákladů a výkonu při využití velkých dat oproti tradičním systémům.
  • Prediktivní kódování a technologie podporující vyhledávání důkazů (TAR).
  • Praktická ukázka nástroje vMiner, který demonstruje zrychlené vyhledávání pomocí TAR.
  • Využití HDFS ke zvýšení rychlosti indexování dat.
  • Zpracování přirozeného jazyka – otevřené produkty a metody.
  • Technologie určené k analýze textů v cizích jazycích.

Obchodní inteligence s využitím velkých dat pro oblast kybernetické bezpečnosti – celkový přehled, rychlý sběr informací a identifikaci hrozeb

  • Přehled základů bezpečnostní analytiky – povrch útoků, špatné nastavení systémů či ochrana jednotlivých zařízení.
  • Síťová infrastruktura a rozsáhlé datové kanály s využitím procesu ETL k reálné analýze.
  • Konfrontace přístupů – pevně definovaná pravidla vs. automatické rozpoznávání potenciálních hrozeb na základě metadat.

Shromažďování různorodých dat pro účely analýzy kriminalistických informací

  • Použití IoT (Internet věcí) jako senzorů určených ke sběru dat.
  • Využívání satelitních snímků pro vnitrostátní sledování aktivit.
  • Využití monitorovacích a obrazových dat k identifikaci pachatelů.
  • Další technologie určené ke sběru informací – drony, tělesné kamery, systémy s GPS geolokací či termální snímkování.
  • Kombinace automatizovaného získávání dat s informacemi od informátorů, výslechů a vlastního výzkumu.
  • Předpovídání možné kriminality na základě analýz.

Den 4

Analytika zaměřená na prevenci podvodů s využitím velkých dat a metod prediktivní analýzy

  • Základní rozdělení přístupů k detekci podvodů – metody založené na pravidlech a prediktivní techniky.
  • Porovnání strojového učení s hlídáním bez dohledu pro odhalování vzorců nekalých jednání.
  • Podvody mezi firmami, podvádění s pojištěním a lékařskými pojistkami, daňové úniky či praní špinavých peněz.

Analytika sociálních médií – shromažďování a zpracování informací z internetu

  • Jak zločinci využívají sociální sítě k organizaci, náboru členů a plánování aktivit.
  • Rozhraní ETL typu API určené k extrakci informací ze sociálních médií.
  • Texty, obrázky, metadata a videa.
  • Analýza názorů či postojů vyjádřených v sociálních sítích.
  • Filtrování obsahu dle kontextu i mimo něj.
  • Systém dashboardů určený k integraci různých typů sociálních médií.
  • Automatické profilování uživatelských účtů na sociálních sítích.
  • Praktická ukázka jednotlivých analytických postupů za použití nástroje Treeminer.

Analýza obrazových a video dat pomocí technologií velkých dat

  • Metody ukládání obrazů v systémech velkých dat – řešení pro archivaci petabajtového objemu dat.
  • LTFS (Linear Tape File System) a LTO (Linear Tape Open).
  • GPFS-LTFS – vícevrstvé úložiště určené ke správě obrazových dat v rozsáhlém měřítku.
  • Základní principy vizuální analýzy.
  • Rozpoznávání objektů na snímcích.
  • Dělení snímků na jednotlivé části – segmentace obrazu.
  • Sledování pohybu předmětů v čase.
  • Rekonstrukce trojrozměrných modelů z 2D obrazů.

Biometrické metody, DNA analýza a nová generace identifikačních technologií

  • Překročení hranic klasického otiskování prstů či rozpoznávání tváří.
  • Reconnaisance řeči, analýza vzorců psaní (analyze vzoru klávesních stisknutí) a CODIS – kombinovaný systém indexování DNA.
  • Překročení úrovně běžného porovnávání sekvencí DNA: stanovení fyzických rysů osoby na základě vzorků genetické informace.

Dashboardy určené k snadnému přístupu a vizualizaci velkých datových souborů:

  • Integrace stávajících podnikových aplikací s novými dashboardy využívajícími technologie velkých dat.
  • Správa celkového toku informací.
  • Příklad v praxi: dashboardy Tableau a Pentaho.
  • Využití nástrojů pro zpracování dat s možností poskytovat geolokované služby veřejné správě.
  • Systém sledování aktivit v průběhu času a jejich efektivní správa.

Den 5

Jak zdůvodnit implementaci technologií velkých dat v rámci organizace:

  • Výpočet návratnosti investice při zavádění systémů velkých dat.
  • Příklady, jak se šetření času analytikům díky automatizaci sběru a úpravy informací zvyšuje produktivita práce.
  • Snížení nákladů na licencování databázových systémů.
  • Možnosti rychlejšího generování příjmů díky využití geolokovaných služeb.
  • Úspora nákladů plynoucí z efektivnější prevence podvodů.
  • Postup pro vypočítání předpokládaných výdajů a očekávaných přínosů ze zavedení velkých dat.

Krok za krokem: Jak nahradit tradiční datový systém moderním řešením pro práci s velkými daty

  • Cesta migrace do prostředí velkých dat.
  • Jaké informace je nutné znát před samotným navrhováním koncepce nového systému?
  • Různé metody určování objemu, rychlosti, rozmanitosti a spolehlivosti průtoků dat.
  • Jak odhadnout budoucí nárůst množství informací?
  • Příklady z praxe.

Podrobný přehled dodavatelů technologií velkých dat a jejich produktů.

  • Accenture
  • APTEAN (dříve CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (dříve 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (součást skupiny EMC)

Část pro otázky a odpovědi.

Požadavky

  • Znalost postupů činnosti orgánů činných v trestním řízení a datových systémů
  • Základní znalost jazyka SQL, databáze Oracle nebo relačních databází
  • Základní porozumění statistice (na úrovni práce s tabulkovými procesory)

Cílové skupiny

  • Odborníci z řad orgánů činných v trestním řízení s technickým backgroundem
 35 Hodiny

Počet účastníků


Cena za účastníka

Reference (3)

Nadcházející kurzy

Související kategorie