Návrh Školení
Den 1
Přehled obchodní inteligence využívající velká data pro analýzu kriminalistických informací
- Případové studie z praxe – prediktivní policejní činnost
- Míra přijetí technologií velkých dat v orgánech činných v trestním řízení a jejich plány pro budoucí využívání prediktivní analýzy na základě velkých dat
- Nové technologické nástroje: senzory na detekci výstřelů, monitorovací video a sociální média
- Využití technologií velkých dat k zmírnění přetížení informacemi
- Propojení technologií velkých dat s tradičními systémy ukládání dat
- Základní orientaci v technologiích umožňujících prediktivní analýzu
- Integrace dat a vizualizace pomocí dashboardů
- Správa podvodů
- Obchodní pravidla a detekce podvodů
- Detekce hrozeb a profilování potenciálních rizik
- Analýza nákladů a přínosů spojených s implementací technologií velkých dat
Úvod do konceptu velkých dat
- Hlavní charakteristiky velkých dat – objem, rozmanitost, rychlost a spolehlivost.
- Architektura MPP (Masivně paralelní zpracování)
- Datové sklady – statická struktura, pomalu se měnící datová sada
- Databáze typu MPP: Greenplum, Exadata, Teradata, Netezza, Vertica apod.
- Řešení založená na platformě Hadoop – nevyžadují předem definovanou strukturu datové sady.
- Typický postup: HDFS, MapReduce (zpracování dat), následný výběr informací z HDFS
- Apache Spark pro streamové zpracování dat
- Dávkové zpracování – vhodné spíše pro analytické účely než interaktivní použití
- Objem dat: CEP (Streamování událostí)
- Běžné volby produktů pro streamování událostí – např. Infostreams, Apama, MarkLogic apod.
- Méně rozvinutá řešení – Storm a S4
- NoSQL databáze (sloupcová nebo klíč-hodnota) – vhodné jako doplněk k tradičním datovým skladům
Řešení typu NoSQL
- Klíč-Hodnota: Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
- Klíč-Hodnota: Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
- Hierarchické klíč-hodnotové úložiště – GT.m, Cache
- Seřazené klíč-hodnotové úložiště – TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
- Cache určená k ukládání klíčů: Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
- Úložiště typu tuple – Gigaspaces, Coord, Apache River
- Objektové databáze – ZopeDB, DB40, Shoal
- Dokumentová úložiště – CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
- Široce používaná sloupcová úložiště – BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI
Různé typy dat: Úvod do problémů při čištění velkých datových sad
- Relační databáze – mají pevnou strukturu; nepodporují flexibilní a experimentální přístup k datům.
- NoSQL systémy – polostrukturované; poskytují dostatek struktury, aby bylo možné ukládat data i bez předchozí definice schématu.
- Problémy při čištění dat
Hadoop
- Kdy se Hadoop používá?
- Strukturovaná data – firemní datové sklady a databáze umožňují ukládat obrovské množství informací (avšak za vysokou cenu), avšak vyžadují striktní strukturu, což není výhodné pro aktivní průzkum dat.
- Polostrukturovaná data – jejich zpracování je s tradičními řešeními obtížné.
- Ukládání velkých dat vyžaduje obrovské úsilí a po nastavení zůstává systém pevně daný.
- Pro zpracování rozmanitých a rozsáhlých dat na běžném hardwaru je ideálním řešením Hadoop.
- Vytvoření Hadoop clusteru vyžaduje pouze běžný počítačový hardware.
Úvod do MapReduce a HDFS
- MapReduce – umožňuje distribuované zpracování dat přes více serverů.
- HDFS – umožňuje lokální dostupnost dat pro výpočty s možností redundance.
- Data mohou být nestrukturovaná či bez předem definovaného schématu (na rozdíl od relačních databází).
- Je na vývojářích, aby data interpretovali.
- Práce s MapReduce vyžaduje znalosti jazyka Java; je také nutné ručně načíst data do HDFS.
Den 2
Ekosystém velkých dat – budování procesů ETL (extrakce, transformace a nahrání) a výběr vhodných nástrojů pro práci s velkými daty
- Hadoop vs. ostatní řešení typu NoSQL.
- Interaktivní a rychlý přístup k datům.
- HBase – sloupcově orientovaná databáze založená na platformě Hadoop.
- Přístup k datům je možný, ale s omezením (maximální velikost 1 PB).
- Nevhodná pro ad hoc analytické účely; využitelná spíše pro logování, počítání a časově závislé analýzy.
- Sqoop – import dat ze standardních databázích do prostředí Hive nebo HDFS (podpora JDBC/ODBC).
- Flume – přesun dat typu streamů (např. logovací data) do systému HDFS.
Systém pro správu velkých dat
- Pohyblivé komponenty a neustále se měnící výpočetní uzly: ZooKeeper – určený k konfiguraci, koordinaci a pojmenování služeb.
- Složité pracovní toky: Oozie – slouží ke správě postupů, vzájemných závislostí a řetězení úloh.
- Nasazení, konfigurace, správa clusterů a jejich aktualizace (práce administrátora): Ambari.
- Využití v cloudu: Whirr.
Prediktivní analýza – základní techniky a strojové učení v oblasti obchodní inteligence
- Úvod do metod strojového učení.
- Naučení se klasifikačním postupům.
- Bayesovská predikce – příprava trénovacích dat.
- Support Vector Machine.
- Algebra p-Tree a vertikální těžení informací u algoritmu KNN.
- Neuronové sítě.
- Při práci s velkým počtem proměnných v rámci velkých dat se využívá metoda Random Forest (RF).
- Automatizace procesů při zpracování velkého množství dat – vícemodelová kombinovaná varianta RF.
- Automatizace pomocí nástroje Soft10-M.
- Nástroj pro analýzu textu – Treeminer.
- Elastické učení se na základě měnících se podmínek.
- Učení s využitím agendových agentů.
- Rozprostřené distribuované učení.
- Seznámení s open-source nástroji pro prediktivní analýzu: R, Python, Rapidminer, Mahut.
Ekosystém prediktivní analýzy a jeho využití při analýze kriminalistických informací
- Technologie a vyšetřovací procesy.
- Analytické zpracávání poznatků.
- Vizualizační analytika.
- Strukturovaná prediktivní analýza.
- Nestrukturovaná prediktivní analýza.
- Profilování hrozeb, podvodů či dodavatelů.
- Rekomendační systémy.
- Detekce vzorců a tendencí.
- Objevování pravidel a scénářů – zjištění příčin selhání, podvodů či optimalizace procesů.
- Určení kořenových příčin problémů.
- Analýza sentimentu (postojů a názorů).
- Analytika CRM systémů.
- Síťová analytika.
- Textová analýza – získávání informací ze zápisů z výslechů, svědeckých výpovědí a příspěvků na internetu.
- Pomocné technologie pro práci s velkým množstvím dat.
- Analytika podvodů.
- Reálná analytika v průběhu chodu systémů.
Den 3
Reálná a škálovatelná analýza dat nad platformou Hadoop
- Důvody, proč běžné analytické algoritmy nefungují v prostředí Hadoop/HDFS.
- Apache Hama – nástroj určený k masivně synchronnímu distribuovanému zpracování dat.
- Apache Spark – platforma pro clusterové výpočty a reálnou analýzu velkých dat.
- CMU Graphics Lab2 – metoda neasynchronního rozděleného zpracování pomocí grafů.
- Algebra p-Tree od nástroje Treeminer – umožňuje snížit počet potřebných výpočetních zařízení při analýze velkých dat.
Nástroje pro elektronické vyhledávání důkazů a forenzní analýzu
- Porovnání nákladů a výkonu při využití velkých dat oproti tradičním systémům.
- Prediktivní kódování a technologie podporující vyhledávání důkazů (TAR).
- Praktická ukázka nástroje vMiner, který demonstruje zrychlené vyhledávání pomocí TAR.
- Využití HDFS ke zvýšení rychlosti indexování dat.
- Zpracování přirozeného jazyka – otevřené produkty a metody.
- Technologie určené k analýze textů v cizích jazycích.
Obchodní inteligence s využitím velkých dat pro oblast kybernetické bezpečnosti – celkový přehled, rychlý sběr informací a identifikaci hrozeb
- Přehled základů bezpečnostní analytiky – povrch útoků, špatné nastavení systémů či ochrana jednotlivých zařízení.
- Síťová infrastruktura a rozsáhlé datové kanály s využitím procesu ETL k reálné analýze.
- Konfrontace přístupů – pevně definovaná pravidla vs. automatické rozpoznávání potenciálních hrozeb na základě metadat.
Shromažďování různorodých dat pro účely analýzy kriminalistických informací
- Použití IoT (Internet věcí) jako senzorů určených ke sběru dat.
- Využívání satelitních snímků pro vnitrostátní sledování aktivit.
- Využití monitorovacích a obrazových dat k identifikaci pachatelů.
- Další technologie určené ke sběru informací – drony, tělesné kamery, systémy s GPS geolokací či termální snímkování.
- Kombinace automatizovaného získávání dat s informacemi od informátorů, výslechů a vlastního výzkumu.
- Předpovídání možné kriminality na základě analýz.
Den 4
Analytika zaměřená na prevenci podvodů s využitím velkých dat a metod prediktivní analýzy
- Základní rozdělení přístupů k detekci podvodů – metody založené na pravidlech a prediktivní techniky.
- Porovnání strojového učení s hlídáním bez dohledu pro odhalování vzorců nekalých jednání.
- Podvody mezi firmami, podvádění s pojištěním a lékařskými pojistkami, daňové úniky či praní špinavých peněz.
Analytika sociálních médií – shromažďování a zpracování informací z internetu
- Jak zločinci využívají sociální sítě k organizaci, náboru členů a plánování aktivit.
- Rozhraní ETL typu API určené k extrakci informací ze sociálních médií.
- Texty, obrázky, metadata a videa.
- Analýza názorů či postojů vyjádřených v sociálních sítích.
- Filtrování obsahu dle kontextu i mimo něj.
- Systém dashboardů určený k integraci různých typů sociálních médií.
- Automatické profilování uživatelských účtů na sociálních sítích.
- Praktická ukázka jednotlivých analytických postupů za použití nástroje Treeminer.
Analýza obrazových a video dat pomocí technologií velkých dat
- Metody ukládání obrazů v systémech velkých dat – řešení pro archivaci petabajtového objemu dat.
- LTFS (Linear Tape File System) a LTO (Linear Tape Open).
- GPFS-LTFS – vícevrstvé úložiště určené ke správě obrazových dat v rozsáhlém měřítku.
- Základní principy vizuální analýzy.
- Rozpoznávání objektů na snímcích.
- Dělení snímků na jednotlivé části – segmentace obrazu.
- Sledování pohybu předmětů v čase.
- Rekonstrukce trojrozměrných modelů z 2D obrazů.
Biometrické metody, DNA analýza a nová generace identifikačních technologií
- Překročení hranic klasického otiskování prstů či rozpoznávání tváří.
- Reconnaisance řeči, analýza vzorců psaní (analyze vzoru klávesních stisknutí) a CODIS – kombinovaný systém indexování DNA.
- Překročení úrovně běžného porovnávání sekvencí DNA: stanovení fyzických rysů osoby na základě vzorků genetické informace.
Dashboardy určené k snadnému přístupu a vizualizaci velkých datových souborů:
- Integrace stávajících podnikových aplikací s novými dashboardy využívajícími technologie velkých dat.
- Správa celkového toku informací.
- Příklad v praxi: dashboardy Tableau a Pentaho.
- Využití nástrojů pro zpracování dat s možností poskytovat geolokované služby veřejné správě.
- Systém sledování aktivit v průběhu času a jejich efektivní správa.
Den 5
Jak zdůvodnit implementaci technologií velkých dat v rámci organizace:
- Výpočet návratnosti investice při zavádění systémů velkých dat.
- Příklady, jak se šetření času analytikům díky automatizaci sběru a úpravy informací zvyšuje produktivita práce.
- Snížení nákladů na licencování databázových systémů.
- Možnosti rychlejšího generování příjmů díky využití geolokovaných služeb.
- Úspora nákladů plynoucí z efektivnější prevence podvodů.
- Postup pro vypočítání předpokládaných výdajů a očekávaných přínosů ze zavedení velkých dat.
Krok za krokem: Jak nahradit tradiční datový systém moderním řešením pro práci s velkými daty
- Cesta migrace do prostředí velkých dat.
- Jaké informace je nutné znát před samotným navrhováním koncepce nového systému?
- Různé metody určování objemu, rychlosti, rozmanitosti a spolehlivosti průtoků dat.
- Jak odhadnout budoucí nárůst množství informací?
- Příklady z praxe.
Podrobný přehled dodavatelů technologií velkých dat a jejich produktů.
- Accenture
- APTEAN (dříve CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB (dříve 10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware (součást skupiny EMC)
Část pro otázky a odpovědi.
Požadavky
- Znalost postupů činnosti orgánů činných v trestním řízení a datových systémů
- Základní znalost jazyka SQL, databáze Oracle nebo relačních databází
- Základní porozumění statistice (na úrovni práce s tabulkovými procesory)
Cílové skupiny
- Odborníci z řad orgánů činných v trestním řízení s technickým backgroundem
Reference (3)
základy a obzvláště si oblíbili připravené dokumenty a cvičení
Rekha Nallam - GE Medical Systems Polska Sp. z o.o.
Kurz - Introduction to Predictive AI
Přeloženo strojem
Deepthi byla velmi citlivá na moje potřeby, dokázala rozpoznat, kdy přidat další vrstvy složitosti a kdy zůstat v rámci strukturovanějšího přístupu. Deepthi opravdu pracovala ve mém tempu a zajistila, abych se naučil používat nové funkce/nástroje sám, nejdřív mi ukázala a pak mi umožnila samostatně vytvářet tyto položky, což skutečně pomohlo zachytit školení. Nesmírně jsem spokojený s výsledky tohoto školení a s úrovní odborností Deepthi!
Deepthi - Invest Northern Ireland
Kurz - IBM Cognos Analytics
Přeloženo strojem
byl dobře připraven - a je velmi sympatický
Oliver - Post CH AG
Kurz - Splunk Fundamentals
Přeloženo strojem