Návrh Školení
1. Úvod do hlubokého učení s posilováním
- Co je to posilovací učení?
- Rozdíly mezi učením s dohledem, bez dohledu a s posilováním
- Aplikace DRL v roce 2025 – robotika, zdravotnictví, finance a logistika
- Pojetí interakcí mezi agentem a prostředím
2. Základy posilovacího učení
- Markovské rozhodovací procesy (MDP)
- Stav, akce, odměna, politika a funkce hodnoty
- Rozdíl mezi průzkumem prostředí a využitím dosažených znalostí
- Metody Monte Carlo a učení na základě časových rozdílů (Temporal-Difference Learning)
3. Implementace základních algoritmů RL
- Tabulkové metody: dynamické programování, vyhodnocování politik a iterativní procesy
- Algoritmy Q-Learning a SARSA
- Strategie průzkumu typu epsilon-greedy s postupným snižováním hodnoty epsilon
- Vytváření prostředí pro učení pomocí knihovny OpenAI Gymnasium
4. Přechod k hlubokému učení s posilováním
- Limitace tabulkových metod
- Využití neuronových sítí k aproximaci funkcí
- Architektura a pracovní postupy modelu Deep Q-Network (DQN)
- Mechanismy opakovaného využívání zkušeností a cílových sítí
5. Pokročilé algoritmy DRL
- Rozšířený DQN, Dueling DQN a metoda upřednostňování opakovaně využitých zkušeností
- Metody gradientů politiky: algoritmus REINFORCE
- Architektury typu Actor-Critic – např. A2C a A3C
- Technika Proximal Policy Optimization (PPO)
- Soft Actor-Critic (SAC)
6. Práce s prostředími majícími spojitý prostor akcí
- Specifické výzvy při řízení v reálném čase
- Využití algoritmu DDPG (Deep Deterministic Policy Gradient)
- Twin Delayed DDPG (TD3)
7. Praktické nástroje a frameworky
- Práce s knihovnami Stable-Baselines3 a Ray RLlib
- Logování a monitorování procesu tréninku pomocí TensorBoard
- Optimalizace hyperparametrů u modelů DRL
8. Tvorba odměn a návrh prostředí
- Formování odměn a vyvažování penalizací
- Koncepty transferu učení ze simulace do skutečného světa
- Vytváření vlastních prostředí pomocí Gymnasium
9. Prostředí s částečně nekompletními informacemi a generalizace
- Řešení situací, kdy informace o stavu jsou nedostatečné (POMDP)
- Využití paměťových prvků na bázi LSTM a RNN
- Zlepšení odolnosti a schopnosti generalizace agentů
10. Teorie her a víceagentní učení s posilováním
- Základy prostředí obsahujících více agentů
- Rozdíly mezi spoluprací a konkurencí mezi agenty
- Aplikace v oblasti konfrontačního trénování a optimalizace strategií
11. Případové studie a praktické aplikace
- Simulace samořiditelných vozidel
- Dynamické cenotvorby a strategie finančního obchodování
- Využití v robotice a průmyslové automatizaci
12. Diagnostika problémů a optimalizace výkonu
- Identifikace nestabilního tréninkového procesu
- Zvládání nedostatečné četnosti udělování odměn a případů nadpřizpůsobení modelu
- Škálování modelů DRL na GPU a v distribuovaných systémech
13. Shrnutí a další směřování
- Přehled architektur DRL a klíčových algoritmů
- Současné trendy v oboru a výzkumné směry – například RLHF a hybridní modely
- Doporučené zdroje informací a studijní materiály
Požadavky
- Znalosti programování v Pythonu
- Pochopení základů matematické analýzy a lineární algebry
- Základní znalosti pravděpodobnosti a statistiky
- Praktické zkušenosti s tvorbou modelů strojového učení pomocí Pythonu, knihoven NumPy či TensorFlow/PyTorch
Cílová skupina
- Vývojáři se zájmem o umělou inteligenci a chytré systémy
- Datoví analytici, kteří se hlouběji zabývají rámci posilovacího učení
- Inženýři strojového učení pracující s autonomními systémy
Reference (3)
Opravdu jsem se líbil konec, kdy jsme si vyzkoušeli CHAT GPT. Místnost nebyla pro toto cvičení nejlepší nastavená - místo jednoho velkého stolu by pomohlo několik menších stolů, abychom se mohli rozdělit do menších skupin a společně přemýšlet.
Nola - Laramie County Community College
Kurz - Artificial Intelligence (AI) Overview
Přeloženo strojem
Práce na základě prvních principů s cíleným zaměřením a následné aplikace případových studií v rámci stejného dne
Maggie Webb - Department of Jobs, Regions, and Precincts
Kurz - Artificial Neural Networks, Machine Learning, Deep Thinking
Přeloženo strojem
Že se používala skutečná společenská data. Trainer měl velmi dobrý přístup tím, že tréninky podporoval účastí a soutěží.
Jimena Esquivel - Zaklad Uslugowy Hakoman Andrzej Cybulski
Kurz - Applied AI from Scratch in Python
Přeloženo strojem